Overfitting e cross validation

Questo set di flashcard copre i concetti di overfitting e cross validation nell'ambito del machine learning, fornendo definizioni e spiegazioni concise per studenti universitari.

AndreaD8·48 fiches·48 questions
universitàcomputer_scienceai_ml
0
Je sais
1 / 48
0
J'apprends
Recto

Cos'è l'overfitting?

Appuyez pour retourner
Verso

L'overfitting è una situazione in cui un modello impara troppo bene i dati di addestramento, perdendo la capacità di generalizzare a dati nuovi.

Appuyez pour retourner
Je sais
J'apprends

Quiz(48 questions)

Question 1 sur 48

1. Qual è l'effetto principale dell'overfitting su un modello?

Termes dans ce set(48)

Fondamenti di Overfitting(16)

Cos'è l'overfitting?

L'overfitting è una situazione in cui un modello impara troppo bene i dati di addestramento, perdendo la capacità di generalizzare a dati nuovi.

Causa principale dell'overfitting?

Modello troppo complesso rispetto alla quantità di dati disponibili. - Esempi: polinomi di alto grado, reti neurali con troppi strati.

Esempio di overfitting.

Un modello prevede perfettamente i risultati di addestramento, ma fallisce su un test set. - Es: previsione del prezzo delle case.

Qual è il segnale dell'overfitting?

Alta accuratezza sui dati di addestramento e bassa accuratezza sui dati di test.

Overfitting vs Underfitting.

Overfitting: modello complesso, errore basso su training. Underfitting: modello semplice, errore alto su entrambi.

Quali dati causano overfitting?

Pochi dati di addestramento, dati rumorosi, caratteristiche irrilevanti.

L'overfitting è sempre negativo?

Falso. In alcuni casi, può rivelare strutture importanti nei dati, ma è generalmente indesiderato.

Impatto delle caratteristiche sui dati.

Caratteristiche irrilevanti aumentano la complessità e possono contribuire all'overfitting.

Cos'è la bias-variance tradeoff?

La relazione tra errori di bias e varianza. Un modello eccessivamente complesso ha alta varianza e può overfittare.

Come si può misurare l'overfitting?

Utilizzando la validazione incrociata per confrontare le performance di addestramento e test.

Come l'overfitting si manifesta negli algoritmi.

Modelli come le reti neurali profonde possono facilmente overfittare, specialmente con dati limitati.

Perché si verifica l'overfitting?

Quando il modello ha troppi parametri rispetto alla quantità di dati disponibili.

Overfitting e noise nei dati.

Il modello può apprendere il rumore invece dei segnali reali, portando a previsioni imprecise.

Fill in the blank: Overfitting è un problema di ______.

generalizzazione.

Quando l'overfitting è più probabile?

Quando il dataset è piccolo e il modello è complesso.

Conseguenza diretta dell'overfitting.

Riduzione della capacità predittiva su dati non visti.

Tecniche di Cross Validation(16)

Cos'è la cross validation?

È una tecnica per valutare le performance di un modello suddividendo i dati in sottogruppi.

Quali sono i principali metodi di cross validation?

1. K-Fold 2. Leave-One-Out 3. Stratified K-Fold 4. Time Series Split

K-Fold Cross Validation → Definizione.

Dividere il dataset in K sottoinsiemi, addestrare K modelli, ciascuno con un diverso sottoinsieme come test.

Vero o Falso: La cross validation elimina l'overfitting.

Falso: La cross validation aiuta a identificare l'overfitting, ma non lo elimina di per sé.

Leave-One-Out Cross Validation (LOOCV) → Caratteristiche.

Utilizza un singolo campione come test e tutti gli altri come addestramento. È costoso computazionalmente.

Compara K-Fold e Stratified K-Fold.

K-Fold suddivide casualmente, mentre Stratified K-Fold mantiene la distribuzione delle classi nel campione.

Quando utilizzare Time Series Split?

Quando i dati sono temporali; mantiene l'ordine temporale durante la suddivisione in training e test.

Definizione di Stratified K-Fold.

Un metodo K-Fold che assicura che ogni fold rappresenti proporzionalmente le classi nel dataset.

Qual è il vantaggio della cross validation?

Fornisce una stima migliore delle performance del modello su dati non visti e riduce la varianza.

Fill in the blank: K nel K-Fold è _____.

Il numero di suddivisioni nel quale il dataset è diviso.

Quali sono i limiti della cross validation?

1. Costi computazionali elevati 2. Tempo di calcolo incrementato

Come si calcola la media delle performance?

Si sommano le performance di ogni fold e si divide per K.

Vero o Falso: LOOCV è sempre migliore di K-Fold.

Falso: LOOCV ha alta varianza e può essere meno efficace rispetto a K-Fold.

Cosa si intende per 'bias-variance tradeoff'?

Equilibrio tra l'errore di bias (sottostima) e l'errore di varianza (sovrastima) nel modello.

Breve esempio di cross validation.

Dataset con 100 campioni, K=5: ogni fold ha 20 campioni come test e 80 come addestramento.

Tecnica di Cross Validation: Nested Cross Validation

Utilizzata per ottimizzare i parametri di modelli complessi. - Consiste in due fasi di cross validation: 1. La prima per ottimizzare i parametri 2. La seconda per valutare le performance del modello ottimizzato. Ideale per prevenire l'overfitting a causa della selezione dei parametri.

Implicazioni e Soluzioni(16)

Cos'è l'overfitting?

L'overfitting si verifica quando un modello si adatta troppo ai dati di addestramento, perdendo la capacità di generalizzare su dati nuovi.

Implicazione principale dell'overfitting?

Riduce l'accuratezza del modello su dati non visti, portando a prestazioni scadenti.

Quale metodo aiuta a prevenire l'overfitting?

La regolarizzazione, che introduce penalizzazioni sui pesi del modello.

Vero o falso: l'overfitting è sempre negativo.

Falso. È una fase normale nel processo di modellazione, ma deve essere monitorato.

Qual è un esempio di overfitting?

Un modello che memoriza ogni singolo punto dati, senza riconoscere pattern generali.

Cosa sono i dati di validazione?

Dati utilizzati per monitorare le prestazioni del modello durante l'addestramento e prevenire l'overfitting.

Confronta overfitting e underfitting.

Overfitting: modello troppo complesso, underfitting: modello troppo semplice.

La cross validation riduce l'overfitting: vero o falso?

Vero. Consente di testare il modello su più sottogruppi di dati.

Cos'è la regolarizzazione L1?

Tecnica che aggiunge una penalità basata sulla somma dei valori assoluti dei pesi nel modello.

Qual è l'effetto di un alto numero di epoche?

Può portare a overfitting, poiché il modello potrebbe adattarsi eccessivamente ai dati di addestramento.

Cosa significa 'early stopping'?

Interrompere l'addestramento prima che il modello inizi a overfittare, osservando le prestazioni sui dati di validazione.

Qual è un vantaggio della cross validation k-fold?

Utilizza più campioni di dati, migliorando l'affidabilità della valutazione del modello.

Cosa implica la scelta di un modello semplice?

Riduce il rischio di overfitting, aumentando la capacità di generalizzazione.

L'overfitting può essere misurato: vero o falso?

Vero. Si può osservare un aumento dell'errore sui dati di test rispetto ai dati di addestramento.

Quale ruolo ha il dropout?

Tecnica che disattiva casualmente una percentuale di neuroni durante l'addestramento per prevenire l'overfitting.

Fill in the blank: L'overfitting è spesso il risultato di __________.

un modello eccessivamente complesso che apprende rumore nei dati.

Questions dans ce set(48)

1. Qual è l'effetto principale dell'overfitting su un modello?

A.Riduce l'accuratezza su dati non visti
B.Aumenta la velocità di addestramento
C.Migliora la generalizzazione
D.Aumenta la complessità del modello

2. Qual è l'obiettivo principale della cross validation?

A.Valutare le performance di un modello
B.Aumentare la dimensione del dataset
C.Ridurre il numero di features
D.Semplificare il modello

3. Cos'è l'overfitting?

A.Un modello che si adatta troppo ai dati di addestramento.
B.Un modello che generalizza bene ai nuovi dati.
C.Un modello che ha bisogno di più dati.
D.Un modello che ha una bassa accuratezza.

4. Quale delle seguenti tecniche è utilizzata per prevenire l'overfitting?

A.Regolarizzazione
B.Aumento delle epoche
C.Aumento della complessità del modello
D.Rimozione dei dati di test

5. Quale metodo di cross validation utilizza tutti i campioni tranne uno per l'addestramento?

A.Leave-One-Out
B.K-Fold
C.Stratified K-Fold
D.Time Series Split

6. Qual è una causa comune dell'overfitting?

A.Utilizzare un modello semplice.
B.Avere troppi dati di addestramento.
C.Avere un modello troppo complesso.
D.Utilizzare tecniche di regolarizzazione.

7. Cos'è il dropout in un modello di rete neurale?

A.Tecnica per prevenire l'overfitting
B.Metodo per aumentare i dati di addestramento
C.Strategia per ridurre il tempo di addestramento
D.Tecnica per aumentare la complessità del modello

8. Quale dei seguenti metodi mantiene la distribuzione originale delle classi?

A.Stratified K-Fold
B.K-Fold
C.Leave-One-Out
D.Random Sampling

9. In quale scenario è più probabile l'overfitting?

A.Quando il dataset è molto grande.
B.Quando ci sono molte caratteristiche irrilevanti.
C.Quando il modello è semplice e lineare.
D.Quando si utilizzano tecniche di ensemble.

10. La cross validation può aiutare a identificare l'overfitting: vero o falso?

A.Vero
B.Falso
C.Solo in alcuni casi
D.Dipende dal tipo di dati

11. Qual è il principale svantaggio del Leave-One-Out?

A.Alti costi computazionali
B.Bassa precisione
C.Difficoltà di implementazione
D.Scarsa interpretabilità

12. Qual è una indicazione di overfitting?

A.Bassa accuratezza sui dati di test.
B.Alta accuratezza sui dati di test.
C.Dati di addestramento incorretti.
D.Un modello semplice.

13. Quale affermazione descrive meglio l'underfitting rispetto all'overfitting?

A.Modello troppo semplice
B.Modello troppo complesso
C.Modello ben bilanciato
D.Modello che generalizza perfettamente

14. Quando è più appropriato utilizzare Time Series Split?

A.Con dati temporali
B.Con dati categorici
C.Con dati immagini
D.Con dati testuali

15. Cosa si intende per 'bias-variance tradeoff'?

A.Un equilibrio tra errori di bias e varianza.
B.La difficoltà nella scelta dei dati di addestramento.
C.Un metodo di regolarizzazione.
D.Un tipo di modello di apprendimento.

16. Qual è uno degli effetti di un alto numero di epoche durante l'addestramento?

A.Può portare a overfitting
B.Può migliorare l'accuratezza
C.Aumenta la velocità di addestramento
D.Riduce la complessità del modello

17. Qual è l'errore di bias?

A.Sottostima delle performance
B.Sovrastima delle performance
C.Variabilità elevata
D.Costi computazionali

18. Quale delle seguenti affermazioni è falsa riguardo l'overfitting?

A.Può portare a previsioni imprecise.
B.È facilmente rilevabile con la validazione incrociata.
C.È sempre desiderabile.
D.Può essere causato da un modello troppo complesso.

19. Cosa implica la regolarizzazione L2?

A.Penalizza la somma dei quadrati dei pesi
B.Aumenta la complessità del modello
C.Riduce i dati di addestramento
D.Disattiva neuroni casualmente

20. In K-Fold Cross Validation, che cosa rappresenta K?

A.Il numero di fold in cui dividere il dataset
B.Il numero di campioni nel dataset
C.Il numero di parametri del modello
D.Il numero di classi nel dataset

21. Come può manifestarsi l'overfitting in un modello di rete neurale?

A.Apprendendo correttamente sia i dati di addestramento che quelli di test.
B.Imparando i dettagli specifici dei dati di addestramento.
C.Mantenendo la stessa accuratezza su tutti i set di dati.
D.Riducendo il numero di parametri.

22. In quale situazione è più probabile che si verifichi l'overfitting?

A.Con un modello complesso e pochi dati
B.Con un modello semplice e tanti dati
C.Con un modello complesso e dati bilanciati
D.Con un modello semplice e pochi dati

23. Quale affermazione riguardo alla cross validation è falsa?

A.Aiuta a identificare l'overfitting
B.Elimina completamente l'overfitting
C.Fornisce una stima delle performance
D.Richiede più tempo di calcolo

24. Qual è una conseguenza diretta dell'overfitting?

A.Miglioramento della generalizzazione.
B.Riduzione della capacità predittiva.
C.Aumento della precisione sui dati di test.
D.Maggiore interpretabilità del modello.

25. Cosa significa 'early stopping'?

A.Interrompere l'addestramento prima dell'overfitting
B.Aumentare il numero di epoche
C.Migliorare la complessità del modello
D.Smettere di utilizzare dati di test

26. Cosa si intende per 'Nested Cross Validation'?

A.Due fasi di cross validation
B.Un metodo di valutazione semplice
C.Un modo per aumentare i dati
D.Una tecnica per ridurre il bias

27. Cosa rappresenta la 'validazione incrociata'?

A.Un metodo per ridurre il rumore nei dati.
B.Una tecnica per valutare la performance del modello.
C.Un modo per semplificare il modello.
D.Un approccio per aumentare i dati di addestramento.

28. Quale dei seguenti è un esempio di overfitting?

A.Un modello che memoriza ogni punto dati
B.Un modello che generalizza bene
C.Un modello che utilizza pochi dati
D.Un modello con bassa complessità

29. Qual è il vantaggio principale di utilizzare la cross validation?

A.Stime più affidabili delle performance su dati non visti
B.Riduzione della complessità del modello
C.Miglioramento del training set
D.Aumento della dimensione del dataset

30. L'overfitting può essere ridotto attraverso quale metodo?

A.Aumentando il numero di parametri.
B.Utilizzando la regolarizzazione.
C.Riducendo il numero di dati.
D.Aggiungendo caratteristiche irrilevanti.

31. Qual è un vantaggio della cross validation rispetto alla suddivisione semplice dei dati?

A.Migliora l'affidabilità della valutazione del modello
B.Riduce il tempo di addestramento
C.Aumenta il numero di dati di addestramento
D.Semplifica la scelta del modello

32. Quale tecnica di cross validation è più costosa in termini di tempo computazionale?

A.Leave-One-Out
B.K-Fold
C.Stratified K-Fold
D.Cross Validation semplice

33. Quale affermazione descrive meglio l'underfitting?

A.Il modello è troppo complesso.
B.Il modello non riesce ad apprendere i dati di addestramento.
C.Il modello ha troppi dati di addestramento.
D.Il modello mostra ottima performance su dati nuovi.

34. Cosa si intende per 'dati di validazione'?

A.Dati usati per monitorare le prestazioni
B.Dati utilizzati per addestrare il modello
C.Dati mai utilizzati nel processo
D.Dati che migliorano l'overfitting

35. Qual è la differenza principale tra K-Fold e Stratified K-Fold?

A.Distribuzione delle classi
B.Numero di fold
C.Tipo di dati
D.Costo computazionale

36. Qual è un esempio pratico di overfitting?

A.Un modello che prevede accuratamente i risultati di un test set.
B.Un modello che apprende i dati di addestramento perfettamente ma non generalizza.
C.Un modello che scarta caratteristiche irrilevanti.
D.Un modello che semplifica i dati.

37. Qual è un effetto dell'utilizzo di un modello semplice?

A.Riduce il rischio di overfitting
B.Aumenta la complessità
C.Migliora l'overfitting
D.Richiede più dati

38. Come si calcola la media delle performance in K-Fold?

A.Sommando le performance e dividendo per K
B.Prendendo il valore massimo
C.Prendendo il valore minimo
D.Utilizzando la mediana

39. Cosa si verifica quando un modello apprende il rumore nei dati?

A.Il modello è robusto.
B.Il modello è generale.
C.Il modello può overfittare.
D.Il modello ha alta precisione.

40. La valutazione del modello su dati di test può rivelare l'overfitting: vero o falso?

A.Vero
B.Falso
C.Solo se i dati sono bilanciati
D.Dipende dal tipo di modello

41. Quale dei seguenti approcci è una forma di cross validation?

A.K-Fold
B.Aprire e chiudere il modello
C.Eliminazione delle feature
D.Semplificazione del dataset

42. Quale delle seguenti affermazioni è vera riguardo l'overfitting?

A.Può essere utile in alcuni casi.
B.Non esiste un modo per misurarlo.
C.È sempre positivo per i modelli.
D.Si verifica solo in modelli lineari.

43. Qual è il principale obiettivo della regolarizzazione?

A.Ridurre l'overfitting
B.Aumentare la complessità
C.Accelerare l'addestramento
D.Eliminare i dati di test

44. Vero o Falso: La cross validation può ridurre la varianza delle performance stimate.

A.Vero
B.Falso
C.Dipende dal modello
D.È irrilevante

45. Quando un modello è considerato 'ben generalizzato'?

A.Quando ha alta accuratezza su dati di addestramento e test.
B.Quando ha bassa varianza.
C.Quando ha molte caratteristiche.
D.Quando è complesso.

46. Quale delle seguenti affermazioni non è vera riguardo all'overfitting?

A.L'overfitting può portare a prestazioni scadenti su dati nuovi.
B.Si verifica solo in modelli complessi.
C.L'overfitting è comune in modelli addestrati con pochi dati.
D.La regolarizzazione può aiutare a prevenirlo.

47. Quale dei seguenti NON è un metodo di cross validation?

A.K-Fold
B.Stratified K-Fold
C.Random Split
D.Linear Regression

48. Perché è importante monitorare l'overfitting durante la formazione di un modello?

A.Per aumentare la complessità del modello.
B.Per garantire un modello performante su dati nuovi.
C.Per ridurre il numero di dati di addestramento.
D.Per evitare l'underfitting.

Sets associés

Créez votre propre set d'étude

Téléchargez un PDF, collez vos notes ou décrivez un sujet – l'IA génère des fiches, des quiz et plus en quelques secondes.

Mis en avant sur