klassifikasjon versus regresjon notater

Notater om klassifikasjon og regresjon i maskinlæring, med fokus på begreper og definisjoner som er viktige for forståelsen av disse metodene.

Olivia58·52 flashkort·52 spørsmål
universitetcomputer_scienceai_ml
0
Kjent
1 / 52
0
Lærer
Forside

Klassifikasjon

Trykk for å vende
Bakside

En metode innen maskinlæring som deler inn data i kategorier basert på egenskaper.

Trykk for å vende
Skjønner
Lærer fortsatt

Quiz(52 spørsmål)

Spørsmål 1 av 52

1. Hva er hovedformålet med støttevektormaskiner (SVM)?

Begreper i dette studiesettet(52)

Grunnleggende begreper(16)

Klassifikasjon

En metode innen maskinlæring som deler inn data i kategorier basert på egenskaper.

Regresjon

En teknikk for å forutsi kontinuerlige verdier. For eksempel, forutsi huspriser basert på kvadratmeter.

Klassifiseringsproblem

Et problem der målet er å forutsi hvilken kategori en ny datapunkt tilhører.

Regresjonsproblem

Et problem der målet er å forutsi en kvantitativ verdi ut fra inputvariabler.

True or False: Klassifikasjon kan brukes til prediksjon av kontinuerlige verdier.

False. Klassifikasjon brukes for kategoriske prediksjoner.

Kategoriske variabler

Variabler som representerer grupper eller kategorier, for eksempel 'rød', 'grønn', 'blå'.

Kontinuerlige variabler

Variabler som kan anta hvilken som helst verdi innenfor et intervall, for eksempel temperatur i grader Celsius.

Overfitting

Når en modell har lært seg å gjenkjenne støy i treningsdataene, noe som reduserer generalisering til nye data.

Underfitting

Når en modell er for enkel til å fange opp mønstre i dataene, noe som fører til dårlig ytelse.

Kryssvalidering

En teknikk for å evaluere modeller ved å dele dataene i flere deler, som sikrer at modellen generaliserer godt.

Feature Engineering

Prosessen med å utvikle nye egenskaper fra eksisterende data for å forbedre modellens ytelse.

Beslutningstre

En grafisk metode for å ta beslutninger basert på en sekvens av spørsmål med ja/nei svar.

Support Vector Machine (SVM)

En kraftig klassifikasjonsmetode som søker å finne den beste grensen mellom klasser.

MSE (Mean Squared Error)

En vanlig metode for å evaluere regresjonsmodeller: MSE=1nextstyle∀i=1n(yi−ildeyi)2\displaystyle MSE = \frac{1}{n} extstyle\forall_{i=1}^{n}(y_i - ilde{y}_i)^2.

R² (R-kvadrat)

Et mål på hvor godt regresjonsmodellen forklarer variasjonen i den avhengige variabelen, mellom 0 og 1.

Prediksjon

Prognose av fremtidige data basert på en modell bygget fra tidligere data.

Klassifikasjonsteknikker(12)

Beskriv støttevektormaskiner.

Støttevektormaskiner (SVM) er en klassifikasjonsmetode som finner den optimale hyperplanet for å skille klasser. Bruker støttevektorer, som er datapunkter nærmest hyperplanet.

Klassifisering med beslutningstrær: hvordan fungerer det?

Beslutningstrær splitter data basert på attributter. Hver node representerer et valg, og hvert blad representerer en klasse. Enkel å tolke og visualisere.

Hva er naive Bayes?

Naive Bayes er en probabilistisk klassifikasjonsmetode som bruker Bayes' teorem og antar uavhengighet mellom attributter. Effektiv for tekstklassifisering.

Sammenlign k-nearest neighbors og støttevektormaskiner.

K-nearest neighbors (KNN) klassifiserer basert på nærmeste naboer i datasettet, mens SVM fester et hyperplan. KNN er enkel, men SVM er ofte mer robust.

Fullfør setningen: Random forest er en samling av _____ .

Random forest er en samling av beslutningstrær. Den øker nøyaktigheten ved å kombinere flere trær for å redusere overtilpasning.

Hvilken metode brukes for å redusere dimensjonalitet før klassifisering?

Hovedkomponentanalyse (PCA) er en metode for å redusere dimensjonalitet ved å transformere data til et nytt sett variabler (hovedkomponenter) som bevarer mest mulig informasjon.

Sann eller usann: Dybdelæring kan brukes til klassifikasjon.

Sann. Dybdelæring, spesielt nevrale nettverk, er effektive for komplekse klassifikasjonsoppgaver som bilde- og talegjenkjenning.

Hva er forskjellen mellom binær og flerklasses klassifikasjon?

Binær klassifikasjon involverer to klasser (f.eks. ja/nei), mens flerklasses klassifikasjon involverer tre eller flere klasser (f.eks. katt, hund, fugl).

Gi et eksempel på en brukerdefinert klassifikasjonsmetode.

En brukerdefinert klassifikasjonsmetode kan være en hybrid av eksisterende algoritmer, som en kombinasjon av beslutningstrær og nevrale nettverk for spesifikke anvendelser.

Hva står 'k' for i k-NN?

'k' står for antall nærmeste naboer som vurderes ved klassifisering. Valg av 'k' kan påvirke nøyaktigheten til modellen.

Beskriv hvordan gradient boost fungerer.

Gradient boost bygger klassifikasjonsmodeller sekvensielt, der hver modell korrigerer feilene fra den forrige. Det gir sterk ytelse ved å kombinere flere svake lærere.

Sammenlign logistisk regresjon og naive Bayes.

Logistisk regresjon estimerer sannsynligheten for klassetilhørighet ved hjelp av en logistisk funksjon, mens naive Bayes vurderer sannsynligheter basert på attributtfordelinger med antatt uavhengighet.

Regresjonsmetoder(12)

Lineær regresjon

En metode for å modellere forholdet mellom en avhengig variabel og en eller flere uavhengige variabler ved hjelp av en lineær funksjon.

Hva er multiple regresjon?

En utvidelse av lineær regresjon som involverer flere uavhengige variabler for å forutsi en avhengig variabel.

Polynomisk regresjon

En regresjonsmetode som bruker polynomfunksjoner for å modellere ikke-lineære forhold mellom variabler.

Når brukes logistisk regresjon?

Logistisk regresjon brukes når den avhengige variabelen er kategorisk, spesielt for å modellere sannsynligheter.

Sann eller usann: Regresjon kan brukes til prediksjon.

Sann. Regresjonsmetoder kan effektivt brukes til å forutsi fremtidige verdier basert på historiske data.

Hva er ridge regresjon?

En teknikk som legger til en straff til størrelsen på koeffisientene for å redusere multikollinearitet i regresjonsmodeller.

Hypotese-testing i regresjon

Tester om koeffisientene er forskjellig fra null for å avgjøre om de uavhengige variablene har en signifikant effekt på den avhengige variabelen.

Hva er hovedforskjellen mellom regresjon og klassifikasjon?

Regresjon forutsier kontinuerlige verdier, mens klassifikasjon forutsier kategoriske resultater.

Sammenlign lineær og polynomisk regresjon.

Lineær regresjon beskriver en rett linje, mens polynomisk regresjon kan avbøye og tilpasse seg kurver i dataene.

Hva er Lasso-regresjon?

Lasso-regresjon er en regresjonsteknikk som bruker L1-regularisering for å redusere overtilpasning og velge variabler.

Forutsigelse med regresjonsmodellen

Gitt en regresjonsmodell y=a+bx\displaystyle y = a + bx, forutsig y\displaystyle y når x=5\displaystyle x = 5 og a=2,b=3\displaystyle a = 2, b = 3.

Hva er varians-bias kompromiss?

Et prinsipp som beskriver balansen mellom feil på grunn av bias (forenkling) og varians (overtilpasning) i regresjonsmodeller.

Evaluering og ytelse(12)

Hva er nøyaktighet (accuracy)?

Andelen riktige prediksjoner av alle prediksjoner gjort av modellen. Beregnes som: TP+TNTP+TN+FP+FN\displaystyle \frac{TP + TN}{TP + TN + FP + FN}.

Definer presisjon (precision).

Andelen sanne positive blant de som ble klassifisert som positive. Formelt: TPTP+FP\displaystyle \frac{TP}{TP + FP}.

Hva er tilbakekalling (recall)?

Andelen sanne positive som korrekt ble identifisert. Beregnes som: TPTP+FN\displaystyle \frac{TP}{TP + FN}.

Fyll ut: F1-score er den harmoniske ______ av presisjon og tilbakekalling.

Gjennomsnitt.

Sammenlign R-squared og justert R-squared.

R-squared måler hvor godt modellen forklarer variasjonen, mens justert R-squared justerer for antall prediktorer som brukes.

Hva er AUC-ROC?

AUC (Area Under Curve) av ROC (Receiver Operating Characteristic) kurven, som viser forholdet mellom sann positiv rate og falsk positiv rate.

Sannsynligheten for feil klassifisering er kjent som ______.

Feilrate.

Definer MSE (Mean Squared Error).

Gjennomsnittet av kvadrerte forskjeller mellom predikerte og faktiske verdier. Formel: MSE=1n∑i=1n(yi−y^i)2\displaystyle MSE = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{y}_i)^2.

Sannhetsmatrise (confusion matrix) viser ______.

Antall sanne positive, sanne negative, falske positive, og falske negative klassifiseringer.

Er MAPE (Mean Absolute Percentage Error) en absolutt eller relativ feilmetode?

Relativ, fordi den uttrykker feil i prosent av de faktiske verdiene.

Hva er krysvalidasjon (cross-validation)?

En teknikk for å evaluere modellens ytelse ved å dele datasettet i trenings- og testsett flere ganger.

Klassifikasjonsrapport oppsummerer ______.

Modellens presisjon, tilbakekalling, F1-score og nøyaktighet for hver klasse.

Spørsmål i dette studiesettet(52)

1. Hva er hovedformålet med støttevektormaskiner (SVM)?

A.Å finne det optimale hyperplanet for å skille klasser
B.Å gruppere data uten forhåndsdefinerte klasser
C.Å estimere kontinuerlige verdier
D.Å analysere tidsseriedata

2. Hva er den primære fordelen med lineær regresjon?

A.Den er enkel å tolke og implementere.
B.Den kan håndtere alle typer data.
C.Den gir alltid nøyaktige prediksjoner.
D.Den er den mest komplekse regresjonsmetoden.

3. Hva er den primære forskjellen mellom nøyaktighet og presisjon?

A.Nøyaktighet tar hensyn til alle klassifiseringer, mens presisjon bare vurderer positive.
B.Presisjon inkluderer både sanne og falske positive klassifiseringer.
C.Nøyaktighet måler bare falske negative.
D.Presisjon er alltid høyere enn nøyaktighet.

4. Hvilken av følgende beskriver best klassifikasjon?

A.En metode for å dele inn data i kategorier basert på egenskaper.
B.En teknikk for å forutsi kontinuerlige verdier.
C.En metode for å evaluere regresjonsmodeller.
D.En prosess for å utvikle nye egenskaper fra eksisterende data.

5. Hvordan fungerer beslutningstrær innen klassifisering?

A.De deler data basert på attributter og gir tydelige beslutningspunkter
B.De vurderer sannsynligheter for hver klasse
C.De bygger på flere modeller samtidig
D.De utfører regresjon for å forutsi verdier

6. Hvilken av følgende metoder brukes ofte for å håndtere multikollinearitet?

A.Hovedkomponentanalyse
B.Ridge regresjon
C.Enkel regresjon
D.Logistisk regresjon

7. Hva representerer F1-score?

A.Den gjennomsnittlige presisjonen av alle klassene.
B.Den harmoniske gjennomsnittet av presisjon og tilbakekalling.
C.Summen av nøyaktighet og tilbakekalling.
D.Maksimal presisjon mellom to klassifikasjoner.

8. Hva er en regresjonsmodell primært brukt til?

A.Å klassifisere data i grupper.
B.Å forutsi en kvantitativ verdi.
C.Å evaluere kategoriske variabler.
D.Å redusere overfitting.

9. Hva kjennetegner naive Bayes-metoden?

A.Den antar uavhengighet mellom attributter
B.Den benytter beslutningstrær
C.Den er kun egnet for binær klassifikasjon
D.Den bruker k-nearest neighbors

10. Når er det passende å bruke polynomisk regresjon?

A.Når dataene viser et kurvelignende mønster.
B.Når den avhengige variabelen er kategorisk.
C.Når det bare er én uavhengig variabel.
D.Når dataene er helt uavhengige.

11. Hvilket av følgende uttrykker forholdet mellom sanne positive og sanne negative?

A.Nøyaktighet.
B.Falsk positiv rate.
C.Tilbakekalling.
D.Presisjon.

12. Hvilket av følgende beskriver et klassifiseringsproblem?

A.Forutsi huspriser basert på kvadratmeter.
B.Bestemme hvilken kategori en ny datapunkt tilhører.
C.Forutsi temperaturen i grader Celsius.
D.Evaluere en regresjonsmodell.

13. Hvilket av følgende beskriver best k-nearest neighbors (KNN)?

A.Den klassifiserer basert på nærmeste naboer
B.Den bygger et komplekst nevralt nettverk
C.Den bruker linære funksjoner for å separere klasser
D.Den er avhengig av store datamengder for trening

14. Hvilket utsagn er korrekt om Lasso-regresjon?

A.Den bruker L2-regularisering.
B.Den kan føre til at noen koeffisienter blir null.
C.Den fungerer bare med store datasett.
D.Den er alltid mer nøyaktig enn ridge regresjon.

15. Hvilken av følgende er IKKE en komponent i sannhetsmatrisen?

A.Sann positive.
B.Sanne negative.
C.Falske negative.
D.Feilrate.

16. Hvilket begrep refererer til variabler som representerer grupper?

A.Kontinuerlige variabler.
B.Kategoriske variabler.
C.Prediktorer.
D.Funksjoner.

17. Hva er hovedfordelen med å bruke Random Forest i klassifikasjon?

A.Den kombinerer flere beslutningstrær for bedre nøyaktighet
B.Den er en enkel lineær klassifikator
C.Den krever lite beregningsressurser
D.Den er kun egnet for binære klassifikasjoner

18. Hva karakteriserer forskjellen mellom regresjon og klassifikasjon?

A.Regresjon forutsier kategoriske verdier.
B.Klassifikasjon kan håndtere kontinuerlige utfall.
C.Regresjon forutsier kontinuerlige verdier.
D.Begge metoder er identiske.

19. Hva måler R-squared?

A.Andelen varians i avhengig variabel som forklares av modellen.
B.Kvaliteten på klassifiseringer i en modell.
C.Kostnaden ved feil klassifisering.
D.Antall parametere i en modell.

20. Hvilken påstand er korrekt om overfitting?

A.Det gjør modellen mer generaliserbar.
B.Det skjer når modellen er for enkel.
C.Det er når modellen lærer seg støy i treningsdataene.
D.Det reduserer kompleksiteten i modellen.

21. Hvilken metode kan brukes for dimensjonalitetsreduksjon før klassifisering?

A.Hovedkomponentanalyse (PCA)
B.Støttevektormaskiner (SVM)
C.Naive Bayes
D.K-nearest neighbors (KNN)

22. Hvilken regresjonsmetode ville vært mest passende for å forutsi sannsynligheten for et utfall?

A.Lineær regresjon
B.Logistisk regresjon
C.Polynomisk regresjon
D.Ridge regresjon

23. Hvilken av følgende representerer AUC-ROC?

A.Området under curve av sann positiv rate versus falsk positiv rate.
B.Den totale nøyaktigheten av en modell.
C.Gjennomsnittet av MSE.
D.Forholdet mellom presisjon og tilbakekalling.

24. Hvilket av følgende beskriver kryssvalidering?

A.En metode for å evaluere regresjonsmodeller.
B.En teknikk for å trene en modell på hele datasettet.
C.En metode for å dele dataene i flere deler for å teste modellen.
D.En prosess for å minimere MSE.

25. Sann eller usann: Dybdelæring kan anvendes for klassifikasjon.

A.Sann
B.Usann
C.Det avhenger av datatypen
D.Kun for spesifikke bransjer

26. Hva er et potensielt problem ved overtilpasning i regresjonsmodeller?

A.Modellen generaliserer godt til nye data.
B.Modellen kan gi høy nøyaktighet på treningsdataene, men dårlig ytelse på testdataene.
C.Modellen er alltid for enkel.
D.Modellen har for mange uavhengige variabler.

27. Hvordan beregnes MSE (Mean Squared Error)?

A.Som gjennomsnittet av kvadrerte forskjeller mellom sanne og predikerte verdier.
B.Som summen av absolutte forskjeller mellom sanne og predikerte verdier.
C.Som prosentandelen av feil prediksjoner.
D.Som differansen mellom sann positiv og falsk negativ rate.

28. Hva er hensikten med feature engineering?

A.Å forutsi fremtidige data.
B.Å utvikle nye egenskaper for å forbedre modellens ytelse.
C.Å klassifisere data i grupper.
D.Å evaluere regresjonsmetoder.

29. Hvilken situasjon beskriver binær klassifikasjon?

A.To klasser som 'ja' eller 'nei'
B.Flere klasser som katt, hund og fugl
C.Klassifisering uten forhåndsdefinerte klasser
D.Analyse av kontinuerlige data

30. Hva er en hovedsjekk når man utfører hypotese-testing i regresjon?

A.Om koeffisientene er forskjellig fra null.
B.Om den avhengige variabelen er konstant.
C.Om dataene er kategoriske.
D.Om modellen er lineær.

31. Hva er hensikten med krysvalidasjon?

A.Å vurdere modellens ytelse mer pålitelig ved å bruke flere datasett.
B.Å øke antall prediktorer i modellen.
C.Å redusere overtilpasning ved å justere hyperparametere.
D.Å maksimere presisjon i modellen.

32. Hvilket av følgende er et eksempel på en grafisk metode for beslutningstaking?

A.Regresjonsanalyse.
B.Beslutningstre.
C.Kryssvalidering.
D.Support Vector Machine.

33. Hva er et eksempel på en hybrid klassifikasjonsmetode?

A.En kombinasjon av beslutningstrær og nevrale nettverk
B.Kun k-nearest neighbors
C.En lineær regresjonsmodell
D.En enkel regresjonsanalyse

34. Hvilken metode kan brukes for å forutsi en verdi gitt en regresjonsmodell?

A.Regresjonsanalyse
B.Sannsynlighetsberegning
C.Inferens
D.Datautvinning

35. Hva beskriver 'Feilrate'?

A.Andelen feilklassifiseringer av en modell.
B.Forskjellen mellom forventet og faktisk verdi.
C.Andelen riktige klassifiseringer.
D.Kostnaden ved sanne positive.

36. Hvilken av følgende beskriver en Support Vector Machine (SVM)?

A.En teknologi for å utvikle nye funksjoner.
B.En klassifikasjonsmetode som finner den beste grensen mellom klasser.
C.En metode for å evaluere regresjonsmodeller.
D.En teknikk for å forutsi tidsseriedata.

37. Hva betyr 'k' i k-NN?

A.Antall nærmeste naboer som vurderes
B.Antall klasser i datasettet
C.En parameter for å justere læringshastigheten
D.Antall beslutningstrær i en forest

38. Hva beskriver varians-bias kompromisset?

A.Forholdet mellom data og modellens kompleksitet.
B.Balansen mellom bias og varians i en modell.
C.Det er en teknikk for datarensing.
D.Det er en metode for å minimere feil i data.

39. Hvilken av følgende definerer tilbakekalling (recall)?

A.Andelen sanne positive identifisert av modellen.
B.Andelen riktige prediksjoner av alle prediksjoner.
C.Antall sanne negative i en klassifikasjon.
D.Forholdet mellom sanne og falske negative.

40. Hvilken variabeltype kan anta hvilken som helst verdi innenfor et intervall?

A.Kategoriske variabler.
B.Kontinuerlige variabler.
C.Nominale variabler.
D.Ordinalvariabler.

41. Hvordan fungerer gradient boost i klassifisering?

A.Den bygger modeller sekvensielt og korrigerer feil
B.Den bruker kun én beslutningstre
C.Den deler data i tilfeldige grupper
D.Den estimerer sannsynligheter basert på attributter

42. Når er det best å bruke enkel regresjon?

A.Når det er en klar lineær sammenheng mellom to variabler.
B.Når det er mange uavhengige variabler.
C.Når dataene er kategoriske.
D.Når man trenger å tilpasse en kurve.

43. Hva er formelen for presisjon?

A.Presisjon = \\frac{TP}{TP + FP}
B.Presisjon = \\frac{TP + TN}{TP + TN + FP + FN}
C.Presisjon = \\frac{TP + FN}{TP}
D.Presisjon = \\frac{FP}{TP + TN}

44. Hva er R² (R-kvadrat) brukt til?

A.Å forutsi kategoriske utfall.
B.Å evaluere hvor godt regresjonsmodellen forklarer variasjonen.
C.Å bestemme kompleksiteten i en modell.
D.Å forhindre overfitting.

45. Hva er forskjellen mellom logistisk regresjon og naive Bayes?

A.Logistisk regresjon bruker en logistisk funksjon for sannsynlighetsestimering
B.Naive Bayes benytter lineære funksjoner
C.Logistisk regresjon er kun for binære klasser
D.Naive Bayes krever komplekse datastrukturer

46. Hvilken av følgende regresjonsmetoder benytter seg av L2-regularisering for å håndtere overtilpasning?

A.Ridge regresjon
B.Logistisk regresjon
C.Multiple regresjon
D.Polynomisk regresjon

47. Hvilket av følgende beskriver best hva AUC-ROC måler?

A.Forholdet mellom sann positiv rate og falsk positiv rate
B.Andelen riktige prediksjoner av modellen
C.Antall sanne positive i en klassifisering
D.Gjennomsnittet av kvadrerte feil mellom faktiske og predikerte verdier

48. Hvilken av følgende påstander er feil angående regresjon?

A.Regresjon brukes til å forutsi kontinuerlige verdier.
B.Regresjon kan brukes til kategoriske prediksjoner.
C.Regresjonsmodeller kan evalueres med MSE.
D.Regresjon kan analysere sammenhenger mellom variabler.

49. Hvordan kan underfitting oppstå?

A.Når modellen har for høy kompleksitet.
B.Når modellen er for enkel til å fange opp mønstre.
C.Når modellen lærer for mye fra treningsdataene.
D.Når modellen ikke vurderer nok data.

50. Hvilken formel representerer MSE (Mean Squared Error)?

A.MSE = (1/n) * Σ(y_i - ŷ_i)^2
B.MSE = Σ(y_i - ŷ_i)
C.MSE = (1/n) * Σ(ŷ_i)
D.MSE = (y - ŷ)^2

51. Hva refererer prediksjon til?

A.Prognose av fremtidige data basert på tidligere data.
B.Et mål på modellens kompleksitet.
C.Prosessen med å dele data i trenings- og testsett.
D.En metode for å evaluere kategoriske utfall.

52. Hvilket av følgende beskriver et regresjonsproblem?

A.Å forutsi huspriser basert på kvadratmeter
B.Å kategorisere bilder av dyr
C.Å dele inn data i grupper
D.Å klassifisere e-poster som spam eller ikke spam

Relaterte studiesett

Lag ditt eget studiesett

Last opp en PDF, lim inn notatene dine, eller beskriv et tema – AI genererer flashkort, quizer og mer på sekunder.