Appunti: Feature engineering pratica
Appunti sui concetti fondamentali e le tecniche di feature engineering, fondamentali per la preparazione dei dati in machine learning.
Quiz(60 vragen)
1. Qual è il principale obiettivo della selezione delle caratteristiche?
Termen in deze set(60)
Concetti base di Feature Engineering(16)
Cos'è la Feature Engineering?
È il processo di creazione e selezione di caratteristiche utili per migliorare le prestazioni di un modello di machine learning.
Perché è importante la Feature Engineering?
Le caratteristiche ben progettate possono aumentare la precisione del modello e ridurre il rischio di overfitting.
Caratteristiche: cosa sono?
Le caratteristiche sono variabili utilizzate come input in un modello di machine learning.
Differenza tra dati grezzi e caratteristiche.
I dati grezzi sono non elaborati; le caratteristiche sono estratte e trasformate per il modello.
Vero o Falso: La Feature Engineering è irrilevante per il successo del modello.
Falso. È fondamentale per migliorare le prestazioni del modello.
Esempio di creazione di una nuova caratteristica.
Da 'prezzo' e 'quantità' a 'valore_totale = prezzo imes quantità'.
Caratteristiche numeriche vs. categoriche.
- Numeriche: rappresentano valori continui. - Categoriche: rappresentano classi o categorie discrete.
Cosa sono le caratteristiche derivate?
Sono caratteristiche create a partire da altre esistenti, come il calcolo di differenze o medie.
Qual è il ruolo della normalizzazione?
Serve a ridurre la scala delle caratteristiche numeriche per migliorare l'addestramento del modello.
Qual è un approccio comune per le variabili categoriali?
L'encoding, come il One-Hot Encoding, trasforma categorie in valori numerici.
Cos'è l'interazione tra caratteristiche?
È la combinazione di più caratteristiche per catturare relazioni più complesse nel modello.
Qual è l'obiettivo del ridimensionamento?
Uniformare la scala delle caratteristiche per evitare che alcune dominino il modello.
Cosa significa 'feature selection'?
È il processo di identificazione delle caratteristiche più rilevanti e significative per il modello.
Qual è l'effetto delle caratteristiche rumorose?
Possono degradare le prestazioni del modello introducendo confusione nei dati.
Da cosa dipende la scelta delle caratteristiche?
Dalla comprensione del dominio, dalle correlazioni e dagli obiettivi del modello.
Qual è la formula della varianza?
Tecniche di Estrazione delle Caratteristiche(20)
Cos'è l'One-Hot Encoding?
È una tecnica per convertire variabili categoriche in una rappresentazione numerica. Ogni categoria è trasformata in una colonna binaria.
Normalizzazione vs. Standardizzazione
Normalizzazione: scala tra 0 e 1. Standardizzazione: media zero e varianza uno. Scelte diverse a seconda dei dati.
Funzione polinomiale
Aggiungere termini polinomiali come può migliorare la capacità del modello di adattarsi a relazioni non lineari nei dati.
Vero o falso: L'estrazione di caratteristiche è sempre necessaria.
Falso. Non è sempre necessaria, dipende dal contesto e dalla qualità dei dati.
Strategia per il log-transform
Utilizzata per ridurre la skewness dei dati. Applicabile a variabili positive: .
Cos'è il Feature Cross?
È creare nuove caratteristiche combinando due o più caratteristiche esistenti, come per catturare interazioni.
A cosa serve il Binning?
Dividere le variabili continue in intervalli. Facilita la modellazione e riduce l'overfitting.
Imputazione dei valori mancanti
Tecniche: media, mediana o moda. Importante per mantenere la integrità dei dati.
Esempio di Feature Engineering
Da 'data' a 'data_ora', estrai 'giorno della settimana' e 'ora'. Aggiunge informazioni temporali utili.
Cos'è l'Encoding Ordinale?
Trasforma variabili categoriche con un ordine naturale in numeri. Esempio: bassa=1, media=2, alta=3.
Qual è l'effetto della riduzione della dimensionalità?
Riduce il numero di caratteristiche. Aiuta a migliorare le prestazioni e ridurre il rumore nei dati.
Cos'è il target encoding?
Sostituisce le categorie con la media del target per ciascuna categoria. Utile nei modelli di regressione.
Differenza tra variabili continue e categoriche
Continue: valori numerici. Categoriche: categorie discrete. Trattamento diverso in feature engineering.
Impatto della scala delle caratteristiche
Caratteristiche su scale diverse possono influenzare negativamente i modelli, specialmente quelli basati su distanza.
Cos'è il Polynomial Feature Expansion?
Genera nuove caratteristiche da combinazioni polinomiali delle esistenti. Può migliorare il fit del modello.
Esempio di estrazione di tempo
Da 'data_ora', estrai 'anno', 'mese', 'giorno'. Aggiunge variabilità e informazioni utili.
Vero o falso: La clusterizzazione è una tecnica di estrazione di caratteristiche.
Vero. Può creare nuove caratteristiche basate su gruppi di dati simili.
Cos'è la feature extraction?
Processo di riduzione dei dati per ottenere caratteristiche importanti, migliorando l'efficienza del modello.
Qual è il ruolo delle variabili derivate?
Caratteristiche create da variabili esistenti. Forniscono maggiore informazione e possono migliorare le prestazioni del modello.
Cos'è la tecnica del Feature Selection?
È un metodo per identificare e scegliere le caratteristiche più rilevanti da utilizzare nel modello, riducendo il rumore e migliorando le prestazioni. - Vantaggi: - Maggiore interpretabilità - Minore rischio di overfitting - Riduzione dei tempi di calcolo.
Preprocessing e Pulizia dei Dati(12)
Cosa significa 'preprocessing' dei dati?
È il processo di preparazione dei dati per l'analisi, includendo pulizia e trasformazione.
Rimuovere i valori nulli →
Migliora la qualità dei dati. - Evita errori nei modelli - Riduce bias
Normalizzazione vs Standardizzazione
Normalizzazione: scala in un intervallo [0, 1]. Standardizzazione: trasforma a media 0 e varianza 1.
Cosa sono i 'valori anomali'?
Sono valori che si discostano notevolmente dagli altri. Possono distorcere i risultati.
Vero o falso: I dati test devono essere puliti.
Vero, perché dati sporchi possono portare a modelli errati e risultati fuorvianti.
Esempio di rimozione dei duplicati:
Se abbiamo due righe identiche, mantenere solo una riga per evitare bias nel modello.
Cosa significa 'imputazione dei dati'?
È il processo di sostituzione di valori mancanti con stime, come media o mediana.
Fill in the blank: La __ è fondamentale per migliorare la qualità delle caratteristiche.
Pulizia dei dati
Cosa è 'feature scaling'?
È un metodo per ridurre la gamma delle caratteristiche, utile in algoritmi sensibili alla scala.
Cause della varianza nei dati:
Errori di misurazione, valori anomali, variabilità naturale del fenomeno.
Come trattare le colonne categoriali?
Utilizzare tecniche come One-Hot Encoding o Label Encoding per trasformarle in numeri.
Perché è importante la qualità dei dati?
Dati di alta qualità portano a modelli più accurati e risultati più affidabili.
Selezione delle Caratteristiche(12)
Selezione delle Caratteristiche
Il processo di identificare e selezionare le caratteristiche più rilevanti per il modello.
Cosa significa 'overfitting'?
È quando un modello si adatta troppo ai dati di addestramento, perdendo capacità di generalizzazione.
Vero o falso: più caratteristiche significano sempre un modello migliore.
Falso. Aggiungere troppe caratteristiche può causare rumore e complicazioni nel modello.
Confronta selezione e estrazione delle caratteristiche.
Selezione: scegli solo alcune caratteristiche. Estrazione: crea nuove caratteristiche da quelle esistenti.
Cosa sono i 'modelli di regressione Lasso'?
Sono modelli che utilizzano la regolarizzazione per ridurre il numero di caratteristiche selezionate.
Esempio di selezione delle caratteristiche
Rimuovere variabili con bassa correlazione rispetto alla variabile target migliora il modello.
Fase di 'feature importance'
Valuta l'impatto di ogni caratteristica sul modello. Utile per la selezione delle caratteristiche.
Quali tecniche di selezione ci sono?
- Filtraggio - Wrapper - Embedded
Cosa sono i 'metodi di filtraggio'?
Tecniche che valutano le caratteristiche in base a metriche statistiche prima della costruzione del modello.
Fill the blank: 'Il ____ è una misura comune per la selezione delle caratteristiche.'
p-value. Misura la significatività statistica delle caratteristiche.
Selezione vs. Regolarizzazione
Selezione: elimina caratteristiche. Regolarizzazione: penalizza complessità del modello.
Cosa è 'Recursive Feature Elimination'?
Un metodo che ripetutamente rimuove le caratteristiche meno importanti e riaddestra il modello.
Vragen in deze set(60)
1. Qual è il principale obiettivo della selezione delle caratteristiche?
2. Qual è l'obiettivo principale dell'One-Hot Encoding?
3. Qual è il principale obiettivo del preprocessing dei dati?
4. Cos'è la Feature Engineering?
5. Cosa si intende per 'overfitting' in un modello?
6. Quale affermazione è vera riguardo alla normalizzazione?
7. Cosa si intende per 'valori nulli' in un dataset?
8. Qual è uno dei motivi principali per cui la Feature Engineering è importante?
9. Vero o falso: Aumentare le caratteristiche migliora sempre il modello.
10. Quando si utilizza la standardizzazione?
11. Quale tecnica NON è comunemente usata per la normalizzazione dei dati?
12. Cosa rappresentano le caratteristiche in un modello di machine learning?
13. Qual è la differenza tra selezione e estrazione delle caratteristiche?
14. Quale tecnica si usa per ridurre la skewness dei dati?
15. Cosa implica l'imputazione dei dati?
16. Qual è la differenza tra dati grezzi e caratteristiche?
17. Cosa rappresentano i 'modelli di regressione Lasso'?
18. Qual è il vantaggio del Binning?
19. Qual è una conseguenza dei valori anomali nei dati?
20. Vero o Falso: La Feature Engineering è irrilevante per il successo del modello.
21. Qual è un esempio di selezione delle caratteristiche?
22. Quale delle seguenti è una tecnica di imputazione dei valori mancanti?
23. Quale affermazione riguardo alla pulizia dei dati è corretta?
24. Qual è un esempio di creazione di una nuova caratteristica?
25. Cosa indica la fase di 'feature importance'?
26. Che cosa si intende per Feature Cross?
27. Cosa si intende per 'feature scaling'?
28. Qual è la differenza tra caratteristiche numeriche e categoriche?
29. Quali tecniche di selezione delle caratteristiche esistono?
30. Qual è l'effetto della riduzione della dimensionalità?
31. Quale dei seguenti metodi è usato per trattare colonne categoriali?
32. Cosa si intende per caratteristiche derivate?
33. Cosa sono i 'metodi di filtraggio'?
34. Qual è la funzione del target encoding?
35. Perché è importante rimuovere i duplicati dai dati?
36. Qual è il ruolo della normalizzazione?
37. Il ____ è una misura comune per la selezione delle caratteristiche.
38. Qual è la differenza principale tra variabili continue e categoriche?
39. Qual è una causa comune di varianza nei dati?
40. Qual è un approccio comune per gestire variabili categoriali?
41. Qual è la principale differenza tra selezione e regolarizzazione?
42. Cosa comporta l'uso di variabili derivate?
43. Cosa significa 'normalizzazione' nei dati?
44. Cosa si intende per interazione tra caratteristiche?
45. Cosa si intende per 'Recursive Feature Elimination'?
46. Quale non è una tecnica di feature selection?
47. Cosa NON è una buona pratica nella preparazione dei dati?
48. Qual è l'obiettivo del ridimensionamento?
49. Qual è un esempio di estrazione di caratteristiche temporali?
50. Cosa significa 'feature selection'?
51. Qual è una conseguenza dell'impattare sulle scale delle caratteristiche?
52. Qual è l'effetto delle caratteristiche rumorose?
53. Cos'è il Polynomial Feature Expansion?
54. Da cosa dipende la scelta delle caratteristiche?
55. Qual è un utilizzo comune di feature engineering?
56. Qual è la formula della varianza?
57. Quale delle seguenti affermazioni è falsa riguardo all'estrazione delle caratteristiche?
58. Quale descrizione si applica meglio alla tecnica del Feature Selection?
59. In quale situazione si utilizza principalmente l'Encoding Ordinale?
60. Qual è una caratteristica distintiva del target encoding rispetto ad altre tecniche?
Gerelateerde sets
Test: KI und ein normales Programm
Trainingsdaten und Bias Notizen
Was maschinelles Lernen macht Schritt für Schritt
Entscheidungsbäume Machine Learning Klausurvorbereitung
Transformer und Large Language Models Klausurvorbereitung
Abitur neuronales Netz Idee
Überwachtes und unüberwachtes Lernen Prüfungsfragen
k-Means Clustering Karteikarten
Maak je eigen studieset
Upload een PDF, plak je notities of beschrijf een onderwerp – AI genereert flashcards, quizzen en meer in seconden.

