Appunti: Feature engineering pratica

Appunti sui concetti fondamentali e le tecniche di feature engineering, fondamentali per la preparazione dei dati in machine learning.

OwlSofia3·60 fiches·60 questions·1 vues
universitàcomputer_scienceai_ml
0
Je sais
1 / 60
0
J'apprends
Recto

Cos'è la Feature Engineering?

Appuyez pour retourner
Verso

È il processo di creazione e selezione di caratteristiche utili per migliorare le prestazioni di un modello di machine learning.

Appuyez pour retourner
Je sais
J'apprends

Quiz(60 questions)

Question 1 sur 60

1. Qual è il principale obiettivo della selezione delle caratteristiche?

Termes dans ce set(60)

Concetti base di Feature Engineering(16)

Cos'è la Feature Engineering?

È il processo di creazione e selezione di caratteristiche utili per migliorare le prestazioni di un modello di machine learning.

Perché è importante la Feature Engineering?

Le caratteristiche ben progettate possono aumentare la precisione del modello e ridurre il rischio di overfitting.

Caratteristiche: cosa sono?

Le caratteristiche sono variabili utilizzate come input in un modello di machine learning.

Differenza tra dati grezzi e caratteristiche.

I dati grezzi sono non elaborati; le caratteristiche sono estratte e trasformate per il modello.

Vero o Falso: La Feature Engineering è irrilevante per il successo del modello.

Falso. È fondamentale per migliorare le prestazioni del modello.

Esempio di creazione di una nuova caratteristica.

Da 'prezzo' e 'quantità' a 'valore_totale = prezzo imes quantità'.

Caratteristiche numeriche vs. categoriche.

- Numeriche: rappresentano valori continui. - Categoriche: rappresentano classi o categorie discrete.

Cosa sono le caratteristiche derivate?

Sono caratteristiche create a partire da altre esistenti, come il calcolo di differenze o medie.

Qual è il ruolo della normalizzazione?

Serve a ridurre la scala delle caratteristiche numeriche per migliorare l'addestramento del modello.

Qual è un approccio comune per le variabili categoriali?

L'encoding, come il One-Hot Encoding, trasforma categorie in valori numerici.

Cos'è l'interazione tra caratteristiche?

È la combinazione di più caratteristiche per catturare relazioni più complesse nel modello.

Qual è l'obiettivo del ridimensionamento?

Uniformare la scala delle caratteristiche per evitare che alcune dominino il modello.

Cosa significa 'feature selection'?

È il processo di identificazione delle caratteristiche più rilevanti e significative per il modello.

Qual è l'effetto delle caratteristiche rumorose?

Possono degradare le prestazioni del modello introducendo confusione nei dati.

Da cosa dipende la scelta delle caratteristiche?

Dalla comprensione del dominio, dalle correlazioni e dagli obiettivi del modello.

Qual è la formula della varianza?

Var(X)=1Nimesextsomma((xi−xˉ)2)\displaystyle Var(X) = \frac{1}{N} imes ext{somma}((x_i - \bar{x})^2)

Tecniche di Estrazione delle Caratteristiche(20)

Cos'è l'One-Hot Encoding?

È una tecnica per convertire variabili categoriche in una rappresentazione numerica. Ogni categoria è trasformata in una colonna binaria.

Normalizzazione vs. Standardizzazione

Normalizzazione: scala tra 0 e 1. Standardizzazione: media zero e varianza uno. Scelte diverse a seconda dei dati.

Funzione polinomiale

Aggiungere termini polinomiali come x2\displaystyle x^2 può migliorare la capacità del modello di adattarsi a relazioni non lineari nei dati.

Vero o falso: L'estrazione di caratteristiche è sempre necessaria.

Falso. Non è sempre necessaria, dipende dal contesto e dalla qualità dei dati.

Strategia per il log-transform

Utilizzata per ridurre la skewness dei dati. Applicabile a variabili positive: y′=log(y+1)\displaystyle y' = log(y + 1).

Cos'è il Feature Cross?

È creare nuove caratteristiche combinando due o più caratteristiche esistenti, come x1∗x2\displaystyle x_1 * x_2 per catturare interazioni.

A cosa serve il Binning?

Dividere le variabili continue in intervalli. Facilita la modellazione e riduce l'overfitting.

Imputazione dei valori mancanti

Tecniche: media, mediana o moda. Importante per mantenere la integrità dei dati.

Esempio di Feature Engineering

Da 'data' a 'data_ora', estrai 'giorno della settimana' e 'ora'. Aggiunge informazioni temporali utili.

Cos'è l'Encoding Ordinale?

Trasforma variabili categoriche con un ordine naturale in numeri. Esempio: bassa=1, media=2, alta=3.

Qual è l'effetto della riduzione della dimensionalità?

Riduce il numero di caratteristiche. Aiuta a migliorare le prestazioni e ridurre il rumore nei dati.

Cos'è il target encoding?

Sostituisce le categorie con la media del target per ciascuna categoria. Utile nei modelli di regressione.

Differenza tra variabili continue e categoriche

Continue: valori numerici. Categoriche: categorie discrete. Trattamento diverso in feature engineering.

Impatto della scala delle caratteristiche

Caratteristiche su scale diverse possono influenzare negativamente i modelli, specialmente quelli basati su distanza.

Cos'è il Polynomial Feature Expansion?

Genera nuove caratteristiche da combinazioni polinomiali delle esistenti. Può migliorare il fit del modello.

Esempio di estrazione di tempo

Da 'data_ora', estrai 'anno', 'mese', 'giorno'. Aggiunge variabilità e informazioni utili.

Vero o falso: La clusterizzazione è una tecnica di estrazione di caratteristiche.

Vero. Può creare nuove caratteristiche basate su gruppi di dati simili.

Cos'è la feature extraction?

Processo di riduzione dei dati per ottenere caratteristiche importanti, migliorando l'efficienza del modello.

Qual è il ruolo delle variabili derivate?

Caratteristiche create da variabili esistenti. Forniscono maggiore informazione e possono migliorare le prestazioni del modello.

Cos'è la tecnica del Feature Selection?

È un metodo per identificare e scegliere le caratteristiche più rilevanti da utilizzare nel modello, riducendo il rumore e migliorando le prestazioni. - Vantaggi: - Maggiore interpretabilità - Minore rischio di overfitting - Riduzione dei tempi di calcolo.

Preprocessing e Pulizia dei Dati(12)

Cosa significa 'preprocessing' dei dati?

È il processo di preparazione dei dati per l'analisi, includendo pulizia e trasformazione.

Rimuovere i valori nulli →

Migliora la qualità dei dati. - Evita errori nei modelli - Riduce bias

Normalizzazione vs Standardizzazione

Normalizzazione: scala in un intervallo [0, 1]. Standardizzazione: trasforma a media 0 e varianza 1.

Cosa sono i 'valori anomali'?

Sono valori che si discostano notevolmente dagli altri. Possono distorcere i risultati.

Vero o falso: I dati test devono essere puliti.

Vero, perché dati sporchi possono portare a modelli errati e risultati fuorvianti.

Esempio di rimozione dei duplicati:

Se abbiamo due righe identiche, mantenere solo una riga per evitare bias nel modello.

Cosa significa 'imputazione dei dati'?

È il processo di sostituzione di valori mancanti con stime, come media o mediana.

Fill in the blank: La __ è fondamentale per migliorare la qualità delle caratteristiche.

Pulizia dei dati

Cosa è 'feature scaling'?

È un metodo per ridurre la gamma delle caratteristiche, utile in algoritmi sensibili alla scala.

Cause della varianza nei dati:

Errori di misurazione, valori anomali, variabilità naturale del fenomeno.

Come trattare le colonne categoriali?

Utilizzare tecniche come One-Hot Encoding o Label Encoding per trasformarle in numeri.

Perché è importante la qualità dei dati?

Dati di alta qualità portano a modelli più accurati e risultati più affidabili.

Selezione delle Caratteristiche(12)

Selezione delle Caratteristiche

Il processo di identificare e selezionare le caratteristiche più rilevanti per il modello.

Cosa significa 'overfitting'?

È quando un modello si adatta troppo ai dati di addestramento, perdendo capacità di generalizzazione.

Vero o falso: più caratteristiche significano sempre un modello migliore.

Falso. Aggiungere troppe caratteristiche può causare rumore e complicazioni nel modello.

Confronta selezione e estrazione delle caratteristiche.

Selezione: scegli solo alcune caratteristiche. Estrazione: crea nuove caratteristiche da quelle esistenti.

Cosa sono i 'modelli di regressione Lasso'?

Sono modelli che utilizzano la regolarizzazione per ridurre il numero di caratteristiche selezionate.

Esempio di selezione delle caratteristiche

Rimuovere variabili con bassa correlazione rispetto alla variabile target migliora il modello.

Fase di 'feature importance'

Valuta l'impatto di ogni caratteristica sul modello. Utile per la selezione delle caratteristiche.

Quali tecniche di selezione ci sono?

- Filtraggio - Wrapper - Embedded

Cosa sono i 'metodi di filtraggio'?

Tecniche che valutano le caratteristiche in base a metriche statistiche prima della costruzione del modello.

Fill the blank: 'Il ____ è una misura comune per la selezione delle caratteristiche.'

p-value. Misura la significatività statistica delle caratteristiche.

Selezione vs. Regolarizzazione

Selezione: elimina caratteristiche. Regolarizzazione: penalizza complessità del modello.

Cosa è 'Recursive Feature Elimination'?

Un metodo che ripetutamente rimuove le caratteristiche meno importanti e riaddestra il modello.

Questions dans ce set(60)

1. Qual è il principale obiettivo della selezione delle caratteristiche?

A.Identificare le caratteristiche più rilevanti per il modello.
B.Aumentare il numero di caratteristiche nel modello.
C.Migliorare la visualizzazione dei dati.
D.Evitare l'uso di modelli complessi.

2. Qual è l'obiettivo principale dell'One-Hot Encoding?

A.Convertire variabili categoriche in formato numerico
B.Ridurre la dimensionalità dei dati
C.Applicare trasformazioni logaritmiche
D.Creare nuove variabili da quelle esistenti

3. Qual è il principale obiettivo del preprocessing dei dati?

A.Preparare i dati per l'analisi
B.Aumentare le dimensioni del dataset
C.Ridurre il tempo di calcolo
D.Escludere tutte le colonne

4. Cos'è la Feature Engineering?

A.È il processo di creazione e selezione di caratteristiche per modelli di machine learning.
B.È la fase di raccolta dati grezzi senza alcuna elaborazione.
C.È un metodo per ridurre il numero di dati in un dataset.
D.È un sistema di valutazione delle prestazioni dei modelli.

5. Cosa si intende per 'overfitting' in un modello?

A.Un modello che non si adatta ai dati di addestramento.
B.Un modello che ha una buona capacità di generalizzazione.
C.Un modello che si adatta troppo ai dati di addestramento.
D.Un modello che utilizza troppe caratteristiche.

6. Quale affermazione è vera riguardo alla normalizzazione?

A.Porta i dati in un intervallo da 0 a 1
B.Standardizza i dati a media zero
C.Rimuove le variabili categoriche
D.Aggiunge variabili polinomiali

7. Cosa si intende per 'valori nulli' in un dataset?

A.Valori completamente assenti
B.Valori che sono zero
C.Valori duplicati
D.Valori estremi

8. Qual è uno dei motivi principali per cui la Feature Engineering è importante?

A.Aumenta la precisione del modello e riduce l'overfitting.
B.Riduce la complessità del modello senza influire sulle prestazioni.
C.Elimina la necessità di dati grezzi.
D.Permette di ignorare le variabili categoriche.

9. Vero o falso: Aumentare le caratteristiche migliora sempre il modello.

A.Vero
B.Falso
C.Solo in modelli complessi
D.Solo se le caratteristiche sono correlate

10. Quando si utilizza la standardizzazione?

A.Quando i dati seguono una distribuzione normale
B.Quando si hanno solo variabili categoriche
C.Quando i dati sono già normalizzati
D.Quando si vuole aumentare la varianza

11. Quale tecnica NON è comunemente usata per la normalizzazione dei dati?

A.Min-Max Scaling
B.Z-score Normalization
C.Log Transformation
D.One-Hot Encoding

12. Cosa rappresentano le caratteristiche in un modello di machine learning?

A.Variabili utilizzate come input.
B.Solo dati grezzi.
C.Solo risultati finali.
D.Un tipo di algoritmo.

13. Qual è la differenza tra selezione e estrazione delle caratteristiche?

A.La selezione sceglie caratteristiche esistenti, l'estrazione crea nuove caratteristiche.
B.La selezione crea nuove caratteristiche, l'estrazione sceglie caratteristiche esistenti.
C.Entrambi i processi sono identici.
D.La selezione riguarda solo modelli di regressione.

14. Quale tecnica si usa per ridurre la skewness dei dati?

A.Log-transform
B.One-Hot Encoding
C.Binning
D.Feature Selection

15. Cosa implica l'imputazione dei dati?

A.Sostituzione di valori mancanti
B.Rimozione di outlier
C.Standardizzazione di caratteristiche
D.Duplicazione di righe

16. Qual è la differenza tra dati grezzi e caratteristiche?

A.I dati grezzi non sono elaborati, mentre le caratteristiche sono trasformate per il modello.
B.Non c'è differenza; sono la stessa cosa.
C.Le caratteristiche sono solo dati storici.
D.I dati grezzi sono sempre strutturati.

17. Cosa rappresentano i 'modelli di regressione Lasso'?

A.Modelli senza regolarizzazione.
B.Modelli che utilizzano la regolarizzazione per ridurre le caratteristiche.
C.Modelli dedicati solo alla classificazione.
D.Modelli che richiedono molte caratteristiche.

18. Qual è il vantaggio del Binning?

A.Riduce l'overfitting
B.Aumenta la dimensionalità
C.Crea variabili polinomiali
D.Convertire variabili categoriche

19. Qual è una conseguenza dei valori anomali nei dati?

A.Potrebbero distorcere i risultati
B.Migliorano la precisione del modello
C.Riduce la complessità del modello
D.Non hanno alcun effetto

20. Vero o Falso: La Feature Engineering è irrilevante per il successo del modello.

A.Falso, è fondamentale per le prestazioni del modello.
B.Vero, non influisce sulle prestazioni.
C.Falso, ma solo in alcuni casi.
D.Vero, è solo un aspetto tecnico.

21. Qual è un esempio di selezione delle caratteristiche?

A.Rimuovere caratteristiche con alta correlazione.
B.Aggiungere nuove caratteristiche al dataset.
C.Utilizzare solo dati numerici.
D.Applicare algoritmi di clustering.

22. Quale delle seguenti è una tecnica di imputazione dei valori mancanti?

A.Media
B.Normalizzazione
C.One-Hot Encoding
D.Binning

23. Quale affermazione riguardo alla pulizia dei dati è corretta?

A.È un passaggio facoltativo
B.Dovrebbe essere sempre la prima fase
C.Non è necessaria per i dati di addestramento
D.È fondamentale per garantire l'affidabilità

24. Qual è un esempio di creazione di una nuova caratteristica?

A.Calcolare il valore totale da prezzo e quantità.
B.Raccogliere dati da fonti diverse.
C.Filtrare i dati in base alla loro età.
D.Utilizzare solo variabili categoriche.

25. Cosa indica la fase di 'feature importance'?

A.La correlazione tra variabili.
B.L'impatto di ogni caratteristica sul modello.
C.La complessità del modello.
D.L'accuratezza del modello.

26. Che cosa si intende per Feature Cross?

A.Combinare due o più caratteristiche esistenti
B.Ridurre la dimensionalità
C.Imputare valori mancanti
D.Standardizzare i dati

27. Cosa si intende per 'feature scaling'?

A.Ridurre la gamma delle caratteristiche
B.Aumentare la complessità del modello
C.Aggiungere nuove caratteristiche
D.Duplice presenza di variabili

28. Qual è la differenza tra caratteristiche numeriche e categoriche?

A.Numeriche rappresentano valori continui; categoriche rappresentano classi discrete.
B.Numeriche sono sempre positive; categoriche possono essere negative.
C.Numeriche sono misurate in euro; categoriche in chilometri.
D.Non c'è differenza tra le due.

29. Quali tecniche di selezione delle caratteristiche esistono?

A.Filtraggio, Wrapper, Embedded
B.Clustering, Regressione, Classificazione
C.Analisi del sentiment, Web scraping, Data mining
D.Normalizzazione, Standardizzazione, Scaling

30. Qual è l'effetto della riduzione della dimensionalità?

A.Migliora le prestazioni dei modelli
B.Aumenta il rumore nei dati
C.Rende i dati più complessi
D.Impedisce l'interpretazione

31. Quale dei seguenti metodi è usato per trattare colonne categoriali?

A.One-Hot Encoding
B.Min-Max Scaling
C.Standardizzazione
D.Rimozione di duplicati

32. Cosa si intende per caratteristiche derivate?

A.Caratteristiche create a partire da altre esistenti.
B.Caratteristiche che non sono mai state utilizzate prima.
C.Caratteristiche che provengono da una sola fonte.
D.Caratteristiche che non hanno correlazione.

33. Cosa sono i 'metodi di filtraggio'?

A.Tecniche che valutano le caratteristiche prima della costruzione del modello.
B.Tecniche che creano nuove caratteristiche.
C.Tecniche che utilizzano solo dati numerici.
D.Tecniche che non richiedono analisi statistiche.

34. Qual è la funzione del target encoding?

A.Sostituisce categorie con la media del target
B.Normalizza i dati
C.Imputa valori mancanti
D.Crea variabili polinomiali

35. Perché è importante rimuovere i duplicati dai dati?

A.Per evitare bias nel modello
B.Per migliorare la leggibilità
C.Per aumentare il numero di righe
D.Per ridurre i valori nulli

36. Qual è il ruolo della normalizzazione?

A.Ridurre la scala delle caratteristiche numeriche.
B.Aumentare il numero di variabili nel dataset.
C.Eliminare variabili non necessarie.
D.Rendere i dati grezzi più complessi.

37. Il ____ è una misura comune per la selezione delle caratteristiche.

A.p-value
B.r-squared
C.root mean square error
D.confusion matrix

38. Qual è la differenza principale tra variabili continue e categoriche?

A.Le prime sono numeriche, le seconde sono discrete
B.Le prime sono sempre binarie
C.Le seconde possono essere numeriche
D.Non esiste differenza

39. Qual è una causa comune di varianza nei dati?

A.Errori di misurazione
B.Valori medi
C.Variabili costanti
D.Standardizzazione corretta

40. Qual è un approccio comune per gestire variabili categoriali?

A.L'encoding, come il One-Hot Encoding.
B.Ignorare le variabili categoriali.
C.Convertirle tutte in numeriche senza alcun metodo.
D.Utilizzare solo variabili numeriche.

41. Qual è la principale differenza tra selezione e regolarizzazione?

A.La selezione elimina caratteristiche, la regolarizzazione penalizza la complessità.
B.La selezione crea nuove caratteristiche, la regolarizzazione non lo fa.
C.La selezione è un processo più veloce della regolarizzazione.
D.Non ci sono differenze significative.

42. Cosa comporta l'uso di variabili derivate?

A.Aggiungere informazioni utili
B.Ridurre la dimensionalità
C.Eliminare variabili
D.Standardizzare i dati

43. Cosa significa 'normalizzazione' nei dati?

A.Portare i valori in un intervallo definito
B.Rimuovere i valori nulli
C.Applicare la standardizzazione
D.Rimuovere i duplicati

44. Cosa si intende per interazione tra caratteristiche?

A.Combinare più caratteristiche per catturare relazioni complesse.
B.Utilizzare solo una singola caratteristica.
C.Escludere tutte le variabili categoriche.
D.Creare nuove variabili senza alcuna correlazione.

45. Cosa si intende per 'Recursive Feature Elimination'?

A.Un metodo che rimuove le caratteristiche meno importanti e riaddestra il modello.
B.Un metodo che aggiunge caratteristiche a un modello esistente.
C.Un processo di visualizzazione dei dati.
D.Un algoritmo di clustering.

46. Quale non è una tecnica di feature selection?

A.Rimozione di variabili ridondanti
B.Combinazione di variabili
C.Creazione di nuove variabili
D.Identificazione delle variabili più rilevanti

47. Cosa NON è una buona pratica nella preparazione dei dati?

A.Trattare i valori nulli
B.Usare dati sporchi
C.Rimuovere outlier
D.Impiegare feature scaling

48. Qual è l'obiettivo del ridimensionamento?

A.Uniformare la scala delle caratteristiche.
B.Aumentare il numero di dati nel modello.
C.Eliminare caratteristiche non utili.
D.Trasformare dati categoriali in numerici.

49. Qual è un esempio di estrazione di caratteristiche temporali?

A.Estrarre il giorno della settimana da una data
B.Normalizzare una variabile
C.Applicare One-Hot Encoding
D.Ridurre la dimensionalità

50. Cosa significa 'feature selection'?

A.Identificare le caratteristiche più rilevanti per il modello.
B.Aggiungere più variabili per migliorare il modello.
C.Eliminare tutte le caratteristiche non numeriche.
D.Trasformare tutti i dati in un'unica categoria.

51. Qual è una conseguenza dell'impattare sulle scale delle caratteristiche?

A.Può influenzare negativamente i modelli
B.Migliora sempre le prestazioni
C.Rende i dati più complessi
D.Riduce la variabilità

52. Qual è l'effetto delle caratteristiche rumorose?

A.Possono degradare le prestazioni del modello.
B.Migliorano sempre le prestazioni.
C.Non hanno alcun effetto sui dati.
D.Rendono il modello più semplice.

53. Cos'è il Polynomial Feature Expansion?

A.Generare nuove caratteristiche da combinazioni polinomiali
B.Ridurre la dimensionalità
C.Normalizzare i dati
D.Imputare valori mancanti

54. Da cosa dipende la scelta delle caratteristiche?

A.Dalla comprensione del dominio e dagli obiettivi del modello.
B.Solo da algoritmi specifici.
C.Dall'assenza di dati.
D.Dalla casualità.

55. Qual è un utilizzo comune di feature engineering?

A.Migliorare l'accuratezza del modello
B.Creare dati non necessari
C.Eliminare tutte le variabili categoriche
D.Impedire la modellazione

56. Qual è la formula della varianza?

A.Var(X)=1N∑(xi−xˉ)2\displaystyle Var(X) = \frac{1}{N} \sum{(x_i - \bar{x})^2}
B.Var(X)=N∑(xi−xˉ)\displaystyle Var(X) = N \sum{(x_i - \bar{x})}
C.Var(X)=∑(xi2)\displaystyle Var(X) = \sum{(x_i^2)}
D.Var(X)=1N∑(xi+xˉ)2\displaystyle Var(X) = \frac{1}{N} \sum{(x_i + \bar{x})^2}

57. Quale delle seguenti affermazioni è falsa riguardo all'estrazione delle caratteristiche?

A.È sempre necessaria per ogni dataset
B.Può migliorare le prestazioni del modello
C.Può ridurre il rumore nei dati
D.Aiuta a semplificare i modelli

58. Quale descrizione si applica meglio alla tecnica del Feature Selection?

A.Identificare e selezionare le caratteristiche più rilevanti per il modello.
B.Creare nuove caratteristiche da quelle esistenti.
C.Ridurre la dimensione del dataset senza considerare le caratteristiche.
D.Applicare trasformazioni non lineari ai dati.

59. In quale situazione si utilizza principalmente l'Encoding Ordinale?

A.Quando le variabili sono categoriche senza un ordine specifico.
B.Quando le variabili hanno un ordine naturale.
C.Solo per variabili numeriche continue.
D.Per ridurre la dimensionalità dei dati.

60. Qual è una caratteristica distintiva del target encoding rispetto ad altre tecniche?

A.Sostituisce le categorie con la media del target.
B.Genera nuove variabili polinomiali.
C.Riduce il numero di variabili continue.
D.Crea nuove caratteristiche combinando variabili esistenti.

Sets associés

Créez votre propre set d'étude

Téléchargez un PDF, collez vos notes ou décrivez un sujet – l'IA génère des fiches, des quiz et plus en quelques secondes.

Mis en avant sur