Train test split – notatki
Materiał edukacyjny dotyczący techniki podziału danych treningowych i testowych w procesie uczenia maszynowego.
Quiz(10 questions)
1. Co to jest train test split?
Terms in this Study Set(21)
Podstawowe pojęcia(13)
Train test split
Metoda podziału zbioru danych na część treningową i testową, aby ocenić model.
Część treningowa
Zbiór danych, na którym model jest trenowany w celu nauki wzorców.
Część testowa
Zbiór danych, wykorzystywany do oceny wydajności modelu po treningu.
Proporcje podziału
Typowe proporcje to 70/30 lub 80/20 dla treningu i testu.
Cross-validation
Technika walidacji, która dzieli dane na wiele zestawów treningowych i testowych.
Wydajność modelu
Mierzona przy pomocy metryk takich jak dokładność, precyzja, recall.
Overfitting
Zjawisko, gdy model uczy się szczegółów danych treningowych, ale nie generalizuje.
Underfitting
Zjawisko, gdy model jest zbyt prosty, by uchwycić istotne wzorce w danych.
Random state
Parametr używany do kontrolowania losowości podziału danych.
Sklearn
Biblioteka Pythona, która oferuje funkcję train_test_split do łatwego podziału danych.
Zadanie regresji
Modelowanie zależności między zmiennymi ciągłymi na zbiorze treningowym.
Zadanie klasyfikacji
Modelowanie przynależności do klas na podstawie cech zbioru treningowego.
Metryka F1
Miara harmoniczna precyzji i recall, przydatna w klasyfikacji.
Zastosowanie i techniki(8)
Prawda czy fałsz: Train test split jest zawsze 50/50.
Fałsz, ponieważ proporcje zależą od konkretnego przypadku użycia.
Uzupełnij zdanie: W celu oceny modelu, należy użyć __________.
metryk, takich jak dokładność, precyzja, recall.
Różnica między Train test split a Cross-validation
Train test split dzieli dane raz, podczas gdy Cross-validation wielokrotnie.
W jakim celu stosuje się train test split?
Aby ocenić zdolność modelu do generalizacji na nowych danych.
Jakie są konsekwencje overfittingu?
Model osiąga wysoką dokładność na danych treningowych, ale niską na testowych.
Czym jest 'stratified split'?
Podział, który zachowuje proporcje klas w zbiorze testowym i treningowym.
Kiedy używać większej części testowej?
Gdy dostępnych jest mało danych, aby uzyskać wiarygodną ocenę modelu.
Rola losowości w podziale danych
Minimalizuje ryzyko stronniczości w doborze danych do treningu i testu.
Questions in this Study Set(10)
1. Co to jest train test split?
2. Kiedy używać cross-validation zamiast train test split?
3. Jakie proporcje najczęściej stosuje się w train test split?
4. Prawda czy fałsz: Train test split zawsze dzieli dane na 50/50.
5. Kiedy występuje overfitting?
6. Jakie są efekty underfittingu?
7. Czym jest część testowa?
8. Czym jest stratified split?
9. Jakie techniki są alternatywą dla train test split?
10. Jakie są konsekwencje złego podziału danych?
Related Study Sets
Pytania: Sieć neuronowa – perceptron
Pytania: Overfitting
Kolokwium: Regresja liniowa
Uczenie nadzorowane – fiszki
Studia informatyka – Sieci neuronowe – wstęp
Studia informatyka – Uczenie maszynowe – podstawy
Create Your Own Study Set
Upload a PDF, paste your notes, or describe a topic – AI generates flashcards, quizzes and more in seconds.

