Train test split – notatki

Materiał edukacyjny dotyczący techniki podziału danych treningowych i testowych w procesie uczenia maszynowego.

BoldDinosaur583·21 fiszki·10 pytania
studiacomputer_scienceai_ml
0
Umiem
1 / 21
0
Uczę się
Przód

Train test split

Kliknij, aby odwrócić
Tył

Metoda podziału zbioru danych na część treningową i testową, aby ocenić model.

Kliknij, aby odwrócić
Umiem
Uczę się

Quiz(10 pytania)

Pytanie 1 z 10

1. Co to jest train test split?

Pojęcia w tym zestawie(21)

Podstawowe pojęcia(13)

Train test split

Metoda podziału zbioru danych na część treningową i testową, aby ocenić model.

Część treningowa

Zbiór danych, na którym model jest trenowany w celu nauki wzorców.

Część testowa

Zbiór danych, wykorzystywany do oceny wydajności modelu po treningu.

Proporcje podziału

Typowe proporcje to 70/30 lub 80/20 dla treningu i testu.

Cross-validation

Technika walidacji, która dzieli dane na wiele zestawów treningowych i testowych.

Wydajność modelu

Mierzona przy pomocy metryk takich jak dokładność, precyzja, recall.

Overfitting

Zjawisko, gdy model uczy się szczegółów danych treningowych, ale nie generalizuje.

Underfitting

Zjawisko, gdy model jest zbyt prosty, by uchwycić istotne wzorce w danych.

Random state

Parametr używany do kontrolowania losowości podziału danych.

Sklearn

Biblioteka Pythona, która oferuje funkcję train_test_split do łatwego podziału danych.

Zadanie regresji

Modelowanie zależności między zmiennymi ciągłymi na zbiorze treningowym.

Zadanie klasyfikacji

Modelowanie przynależności do klas na podstawie cech zbioru treningowego.

Metryka F1

Miara harmoniczna precyzji i recall, przydatna w klasyfikacji.

Zastosowanie i techniki(8)

Prawda czy fałsz: Train test split jest zawsze 50/50.

Fałsz, ponieważ proporcje zależą od konkretnego przypadku użycia.

Uzupełnij zdanie: W celu oceny modelu, należy użyć __________.

metryk, takich jak dokładność, precyzja, recall.

Różnica między Train test split a Cross-validation

Train test split dzieli dane raz, podczas gdy Cross-validation wielokrotnie.

W jakim celu stosuje się train test split?

Aby ocenić zdolność modelu do generalizacji na nowych danych.

Jakie są konsekwencje overfittingu?

Model osiąga wysoką dokładność na danych treningowych, ale niską na testowych.

Czym jest 'stratified split'?

Podział, który zachowuje proporcje klas w zbiorze testowym i treningowym.

Kiedy używać większej części testowej?

Gdy dostępnych jest mało danych, aby uzyskać wiarygodną ocenę modelu.

Rola losowości w podziale danych

Minimalizuje ryzyko stronniczości w doborze danych do treningu i testu.

Pytania w tym zestawie(10)

1. Co to jest train test split?

A.Metoda podziału danych
B.Algorytm optymalizacji
C.Typ modelu
D.Zbiór danych

2. Kiedy używać cross-validation zamiast train test split?

A.Zbyt mało danych
B.Zbyt wiele danych
C.Model jest skomplikowany
D.Nie ma danych

3. Jakie proporcje najczęściej stosuje się w train test split?

A.50/50
B.70/30
C.80/20
D.90/10

4. Prawda czy fałsz: Train test split zawsze dzieli dane na 50/50.

A.Prawda
B.Fałsz
C.Nie wiem
D.Nie dotyczy

5. Kiedy występuje overfitting?

A.Model uczy się za mało
B.Model uczy się zbyt wiele detali
C.Model działa dobrze na testach
D.Model jest zbyt prosty

6. Jakie są efekty underfittingu?

A.Wysoka dokładność na testach
B.Niska dokładność zarówno na treningu, jak i testach
C.Wysoka precyzja
D.Brak wpływu na model

7. Czym jest część testowa?

A.Zbiór do treningu
B.Zbiór do walidacji
C.Zbiór do oceny modelu
D.Zbiór do generacji

8. Czym jest stratified split?

A.Losowy podział
B.Podział według wartości
C.Podział zachowujący proporcje klas
D.Podział poprzez losowanie

9. Jakie techniki są alternatywą dla train test split?

A.K-Fold
B.Boosting
C.Bagging
D.Regresja

10. Jakie są konsekwencje złego podziału danych?

A.Wysoka wydajność modelu
B.Niska generalizacja modelu
C.Brak wpływu na model
D.Wysoka dokładność

Powiązane zestawy

Stwórz własny zestaw

Wgraj PDF, wklej notatki lub opisz temat – AI wygeneruje fiszki, quizy i więcej w kilka sekund.