evalueringsmetrikker ML

Evaluering av metrikker i maskinlæring er essensielt for å forstå og forbedre ytelsen til modeller. Denne FAQ-en dekker grunnleggende metrikker, deres anvendelse, og hvordan de tolkes.

EmilDahl·50 flashkort·50 spørsmål
universitetcomputer_scienceai_ml
0
Kjent
1 / 50
0
Lærer
Forside

Hva er nøyaktighet?

Trykk for å vende
Bakside

Nøyaktighet er andelen korrekt klassifiserte eksempler. Formelen er Accuracy=TP+TNTP+TN+FP+FN\displaystyle Accuracy = \frac{TP + TN}{TP + TN + FP + FN}.

Trykk for å vende
Skjønner
Lærer fortsatt

Quiz(50 spørsmål)

Spørsmål 1 av 50

1. Hva er formelen for presisjon (precision)?

Begreper i dette studiesettet(50)

Grunnleggende metrikker(16)

Hva er nøyaktighet?

Nøyaktighet er andelen korrekt klassifiserte eksempler. Formelen er Accuracy=TP+TNTP+TN+FP+FN\displaystyle Accuracy = \frac{TP + TN}{TP + TN + FP + FN}.

Definer presisjon.

Presisjon er andelen av positive prediksjoner som er korrekte: Precision=TPTP+FP\displaystyle Precision = \frac{TP}{TP + FP}.

Hva er tilbakekalling?

Tilbakekalling er andelen faktiske positive tilfeller som er korrekt identifisert: Recall=TPTP+FN\displaystyle Recall = \frac{TP}{TP + FN}.

Sann positiv rate vs. falsk positiv rate.

Sann positiv rate: TPR=Recall\displaystyle TPR = Recall. Falsk positiv rate: FPR=FPFP+TN\displaystyle FPR = \frac{FP}{FP + TN}.

Hva er F1-score?

F1-score er det harmoniske gjennomsnittet av presisjon og tilbakekalling: F1=2⋅Precision⋅RecallPrecision+Recall\displaystyle F1 = 2 \cdot \frac{Precision \cdot Recall}{Precision + Recall}.

Definer spesifisitet.

Spesifisitet er andelen negative tilfeller som er korrekt identifisert: Specificity=TNTN+FP\displaystyle Specificity = \frac{TN}{TN + FP}.

Hva er ROC-kurve?

ROC-kurve viser forholdet mellom FPR og TPR ved ulike terskeler. Den brukes til å vurdere klassifiseringsmodellers ytelse.

Forklar AUC.

AUC (Area Under Curve) representerer sannsynligheten for at en tilfeldig positiv klasse vil ha en høyere sannsynlighet enn en tilfeldig negativ klasse.

Når brukes konfusjonsmatrise?

Konfusjonsmatrise brukes for å oppsummere ytelsen til en klassifiseringsmodell med hensyn til sanne og falske klassifiseringer.

Definer ulikhet

Ulikhet måler hvor godt en modell skiller mellom klasser. Høy ulikhet indikerer bedre klassifisering.

Hva er Kappa-statistikk?

Kappa-statistikk måler avtalen mellom observerte og forutsagte klassifiseringer, justert for tilfeldigheter: Kappa=Po−Pe1−Pe\displaystyle Kappa = \frac{P_o - P_e}{1 - P_e}.

Sann negativ rate.

Sann negativ rate er andelen negative tilfeller som er korrekt identifisert: Specificity=TNTN+FP\displaystyle Specificity = \frac{TN}{TN + FP}.

Hva er kostnadsfunksjon?

Kostnadsfunksjonen evaluerer forskjellen mellom prediksjoner og faktiske resultater. Vanlige kostnadsfunksjoner inkluderer MSE og log-tap.

Forklar presisjon-recall-kurven.

Presisjon-recall-kurven viser forholdet mellom presisjon og tilbakekalling ved forskjellige terskler, nyttig for ubalanserte datasett.

Hva er validitet?

Validitet refererer til hvor godt en metrikk måler det den er ment å måle, som kan påvirke evalueringen av modellens ytelse.

Fyll inn: Nøyaktighet = ____ + ____ / ____ + ____ + ____ + ____.

Nøyaktighet = TP + TN / TP + TN + FP + FN.

Klassifiseringsmetrikker(12)

Hva er nøyaktighet (accuracy)?

Nøyaktighet er andelen korrekt klassifiserte eksempler. Formelen er: Accuracy=TP+TNTP+TN+FP+FN\displaystyle Accuracy = \frac{TP + TN}{TP + TN + FP + FN}.

Definer presisjon (precision).

Presisjon er andelen sanne positive blant alle positive prediksjoner: Precision=TPTP+FP\displaystyle Precision = \frac{TP}{TP + FP}.

Hva brukes tilbakekalling (recall) til?

Tilbakekalling måler hvor mange sanne positive som ble identifisert: Recall=TPTP+FN\displaystyle Recall = \frac{TP}{TP + FN}.

Sann positiv (TP) er...

...et korrekt identifisert positivt tilfelle.

Hvordan er F1-score relatert til presisjon og tilbakekalling?

F1-score er det harmoniske gjennomsnittet av presisjon og tilbakekalling: F1=2⋅Precision⋅RecallPrecision+Recall\displaystyle F1 = 2 \cdot \frac{Precision \cdot Recall}{Precision + Recall}.

Hva er spesifisitet (specificity)?

Spesifisitet er andelen sanne negative blant alle faktiske negative tilfeller: Specificity=TNTN+FP\displaystyle Specificity = \frac{TN}{TN + FP}.

True or False: Høy nøyaktighet garanterer alltid god modellprestasjon.

False. Høy nøyaktighet kan være misvisende i ubalanserte datasett.

Definer falsk positiv (FP).

Falsk positiv er et tilfelle der modellen feilaktig klassifiserte et negativt tilfelle som positivt.

Fill in the blank: AUC står for _____.

AUC står for Area Under the Curve.

Hva er ROC-kurve?

ROC-kurve plottet viser forholdet mellom tilbakekalling (TPR) og falsk positiv rate (FPR).

Sammenlign presisjon og tilbakekalling.

- Presisjon fokuserer på positive prediksjoner. - Tilbakekalling fokuserer på faktiske positive.

Hva er en konfusjonsmatrise?

En konfusjonsmatrise oppsummerer ytelsen til en klassifiseringsmodell med TP, TN, FP, FN.

Regresjonsmetrikker(12)

Hva er MSE?

MSE står for Mean Squared Error. Det er gjennomsnittet av de kvadrerte forskjellene mellom faktiske og predikerte verdier.

Fyll inn: RMSE = √_____

RMSE = √MSE. Det gir en forståelse av feil i samme enhet som målvariabelen.

Hva er R²?

R², eller forklaringsgraden, måler hvor mye av variansen i den avhengige variabelen som forklares av den uavhengige variabelen.

Sammenlign MSE og RMSE.

MSE gir større vekt til store feil. RMSE er i samme enhet som målvariabelen, noe som gjør det lettere å tolke.

Er MAE mindre sensitiv for uteliggere enn MSE?

Ja, MAE (Mean Absolute Error) er mindre sensitiv for uteliggere fordi den bruker absolutte feil i stedet for kvadrerte feil.

Hva sier en høy R²-verdi?

En høy R²-verdi indikerer at modellen forklarer en stor del av variansen i dataene.

Forklar hva som menes med residualer.

Residualer er forskjellen mellom faktiske og predikerte verdier. De brukes til å evaluere modellens ytelse.

Hvordan påvirker uteliggere MSE?

Uteliggere vil øke MSE betydelig, da kvadreringen av feilene forsterker effekten av store avvik.

Hva er formelen for MAE?

MAE = 1nimesextsum(∣yi−ildeyi∣)\displaystyle \frac{1}{n} imes ext{sum}(|y_i - ilde{y}_i|), hvor yi\displaystyle y_i er faktiske verdier og ildeyi\displaystyle ilde{y}_i er predikerte verdier.

Er en lav MAE alltid bedre?

Ikke nødvendigvis, MAE må tolkes i sammenheng med problemstillingen og datakvaliteten.

Hva er formålet med å bruke evalueringsmetrikker?

Evalueringsmetrikker hjelper til med å vurdere modellens ytelse og tilpasse den for mer nøyaktige prediksjoner.

Gi et eksempel på hvordan R² beregnes.

R² = 1 - SSresSStot\displaystyle \frac{SS_{res}}{SS_{tot}}, hvor SSres\displaystyle SS_{res} er residual sum of squares og SStot\displaystyle SS_{tot} er total sum of squares.

Modellvalg og tuning(10)

Hva er kryssvalidering?

En metode for å vurdere modellens generaliseringsevne. Den deler dataene i trenings- og testsett flere ganger.

True eller False: Høyere presisjon betyr alltid bedre modell.

False. Høy presisjon kan ignorere omfanget av relevante prediksjoner. Balanse mellom metrikker er viktig.

Hvordan velger man hyperparametre?

Bruk grid search eller tilfeldig søk. Evaluer med kryssvalidering for best resultat.

Fyll inn blank: F1-score er balansen mellom _____ og _____ .

presisjon og recall.

Sammenlign nytte av MSE og MAE.

MSE straffer store feil mer, mens MAE gir jevnere vurdering. Velg basert på problemets krav.

Hva er formelen for R²?

R² = 1 - \frac{SS_{res}}{SS_{tot}}, der SS er summen av kvadrater.

Når bruker man ROC-kurver?

For å evaluere klassifiseringsmodeller og sammenligne ytelsen ved ulike terskler.

Hva er formålet med tidlig stopp?

For å forhindre overtilpasning ved å stoppe treningen når ytelsen på valideringsdata begynner å synke.

Hvordan påvirker datastørrelse modellvalget?

Større datasett muliggjør mer komplekse modeller og bedre generalisering.

Hva er en fordel med ensemblemetoder?

De kombinerer flere modeller for å forbedre nøyaktighet og redusere varians.

Spørsmål i dette studiesettet(50)

1. Hva er formelen for presisjon (precision)?

A.Precision = \\frac{TP}{TP + FP}
B.Precision = \\frac{TP + TN}{TP + TN + FP + FN}
C.Precision = \\frac{TP}{TP + TN}
D.Precision = \\frac{FP}{TP + FP}

2. Hva representerer presisjon i sammenheng med maskinlæring?

A.Andelen av positive prediksjoner som er korrekte.
B.Andelen faktiske negative tilfeller som er korrekt identifisert.
C.Forholdet mellom sanne og falske positive klassifiseringer.
D.Det harmoniske gjennomsnittet av presisjon og tilbakekalling.

3. Hva beskriver MSE?

A.Gjennomsnittet av kvadrerte feil mellom faktiske og predikerte verdier.
B.Gjennomsnittet av de absolutte feilene.
C.Variansen til prediksjonene.
D.Summen av de kvadrerte residualene.

4. Hva er hovedformålet med kryssvalidering?

A.Å vurdere modellens generaliseringsevne
B.Å øke antallet hyperparametre
C.Å forutsi fremtidige data
D.Å redusere datastørrelsen

5. Hva står AUC for i sammenheng med klassifiseringsmetrikker?

A.Area Under the Curve
B.Area Under Control
C.Accuracy Under Conditions
D.Average Under Classification

6. Hvilken av følgende metrikker måler andelen faktiske positive tilfeller som er korrekt identifisert?

A.Tilbakekalling
B.Spesifisitet
C.Nøyaktighet
D.Falsk positiv rate

7. Hvordan beregnes RMSE?

A.Ved å ta kvadratroten av MSE.
B.Ved å ta summen av absolutte feil.
C.Ved å multiplisere MAE med 100.
D.Ved å dele MSE med antall data.

8. Når er det mest hensiktsmessig å bruke R² som evalueringsmetode?

A.Når man arbeider med regresjonsmodeller
B.Når man analyserer tidlige stopp
C.Når man justerer hyperparametre
D.Når man samler inn treningseksempler

9. Hvilken metrikk fokuserer på andelen sanne negative?

A.Spesifisitet (specificity)
B.Presisjon (precision)
C.Tilbakekalling (recall)
D.Nøyaktighet (accuracy)

10. Hva er formelen for nøyaktighet?

A.TP + TN / TP + TN + FP + FN
B.TP / (TP + FP)
C.TN / (TN + FP)
D.2 * (Precision * Recall) / (Precision + Recall)

11. Hva er R² et mål på?

A.Andelen av variansen i den avhengige variabelen som forklares av den uavhengige variabelen.
B.Antallet residualer i modellen.
C.Kvaliteten på dataene.
D.Variansen til modellen.

12. Hvilken av følgende metoder er IKKE vanlig for hyperparameter-tuning?

A.Grid search
B.Tilfeldig søk
C.Gradient descent
D.Bayesiansk optimalisering

13. Hva er en falsk negativ (FN)?

A.Et tilfelle der en positiv prediksjon var korrekt
B.Et tilfelle der en negativ prediksjon var korrekt
C.Et tilfelle der modellen feilaktig klassifiserte et positivt tilfelle som negativt
D.Et tilfelle der modellen riktig klassifiserte et negativt tilfelle

14. Hvilken av følgende beskriver falsk positiv rate?

A.Andelen negative tilfeller som er feilaktig klassifisert som positive.
B.Andelen korrekte negative klassifiseringer.
C.Andelen av positive prediksjoner som er korrekte.
D.Forholdet mellom sanne positive og total antall positive.

15. Hvilket utsagn er sant om MAE?

A.Den er mindre sensitive for uteliggere enn MSE.
B.Den er alltid høyere enn MSE.
C.Den bruker kvadrerte feil.
D.Den måler bare store feil.

16. Hva beskriver F1-score?

A.Balansen mellom presisjon og recall
B.Antall klasser i et dataset
C.Den totale nøyaktigheten til modellen
D.Forskjellen mellom trening og testfeil

17. Hvilken metrikk kombinerer presisjon og tilbakekalling?

A.F1-score
B.Nøyaktighet
C.Spesifisitet
D.ROC-kurve

18. Hva er F1-score?

A.Det harmoniske gjennomsnittet av presisjon og tilbakekalling.
B.Andelen av negative prediksjoner som er korrekte.
C.En metode for å evaluere kostnadsfunksjoner.
D.Måling av hvor mye en modell overfitter.

19. Hva indikerer en høy R²-verdi?

A.Modellen forklarer en stor del av variansen i dataene.
B.Dataene har mange uteliggere.
C.Modellen har høy MSE.
D.Det er ingen residualer.

20. Hva er en ulempe med å bruke MSE sammenlignet med MAE?

A.MSE straffer store feil mer
B.MSE er mindre sensitiv til uteliggere
C.MSE er lettere å tolke
D.MSE er alltid høyere enn MAE

21. Hvilken av følgende beskriver en konfusjonsmatrise?

A.En graf som representerer forholdet mellom sanne og falske positive
B.En tabell som oppsummerer ytelsen til en klassifiseringsmodell
C.En kurve som viser endringer i nøyaktighet over tid
D.En statistisk modell for prediksjon

22. Hvordan kan ROC-kurve brukes i evalueringen av modeller?

A.Den viser forholdet mellom FPR og TPR ved ulike terskeler.
B.Den viser nøyaktighet over tid.
C.Den illustrerer kostnaden ved feilklassifisering.
D.Den oppsummerer antall sanne og falske klassifiseringer.

23. Hva er residualer?

A.Forskjellen mellom faktiske og predikerte verdier.
B.En type feilmåling.
C.Middelverdien av prediksjonene.
D.Variansen i datagrunnlaget.

24. Hvilken tilnærming reduserer risikoen for overtilpasning under trening?

A.Tidlig stopp
B.Kryssvalidering
C.Grid search
D.Normalisering

25. Hva skjer hvis presisjon er høy, men tilbakekalling er lav?

A.Modellen identifiserer de fleste sanne positive
B.Modellen har mange falske negative
C.Modellen har mange falske positive
D.Modellen er perfekt

26. Hva er spesifisitet i maskinlæring?

A.Andelen negative tilfeller som er korrekt identifisert.
B.Andelen faktiske positive tilfeller som er korrekt identifisert.
C.Forholdet mellom sanne positive og falske negative.
D.Det totale antallet klassifiserte tilfeller.

27. Hvordan påvirker uteliggere MSE?

A.De øker MSE betydelig.
B.De reduserer MSE.
C.De har ingen effekt.
D.De gjør MSE mer stabil.

28. Når er ROC-kurver spesielt nyttige?

A.Når man evaluerer klassifiseringsmodeller
B.Når man justerer hyperparametre
C.Når man analyserer regresjonsresultater
D.Når man vurderer datastørrelse

29. Hva er nøyaktighet (accuracy)?

A.Andelen riktig klassifiserte eksempler
B.Andelen sanne positive i forhold til alle positive prediksjoner
C.Andelen sanne negative i forhold til alle faktiske negative tilfeller
D.Forholdet mellom TP og FP

30. Hva er AUC i sammenheng med ROC-kurve?

A.Sannsynligheten for at en tilfeldig positiv klasse har høyere sannsynlighet enn en tilfeldig negativ klasse.
B.Andelen av nøyaktige prediksjoner.
C.Harmonisk gjennomsnitt av presisjon og tilbakekalling.
D.En vurdering av modellens kostnadsfunksjon.

31. Hva er formelen for MAE?

A.MAE = (1/n) * sum(|y_i - ŷ_i|)
B.MAE = (1/n) * sum((y_i - ŷ_i)^2)
C.MAE = max(|y_i - ŷ_i|)
D.MAE = (y_i + ŷ_i) / n

32. Hvilken metode kombinerer flere modeller for å forbedre ytelsen?

A.Ensemblemetoder
B.Kryssvalidering
C.Grid search
D.Normalisering

33. Hvilken metrikk gir informasjon om modellens evne til å identifisere alle positive tilfeller?

A.Tilbakekalling (recall)
B.Spesifisitet
C.F1-score
D.Nøyaktighet

34. Hva måler Kappa-statistikk?

A.Avtalen mellom observerte og forutsagte klassifiseringer, justert for tilfeldigheter.
B.Forholdet mellom presisjon og tilbakekalling.
C.Andelen riktig klassifiserte tilfeller.
D.Effektiviteten av en kostnadsfunksjon.

35. Er en lav MAE alltid bedre?

A.Nei, den må vurderes i sammenheng med problemet og datakvaliteten.
B.Ja, det betyr alltid bedre prediksjoner.
C.Ja, det indikerer ingen feil.
D.Nei, det er irrelevant for modellen.

36. Hva kan være en konsekvens av å bruke for komplekse modeller?

A.Overtilpasning
B.Bedre generalisering
C.Raskere trening
D.Redusert varians

37. Hvilken av følgende er IKKE en klassifiseringsmetrisk?

A.Presisjon
B.Tilbakekalling
C.Riktig rate
D.Spesifisitet

38. Hva brukes en konfusjonsmatrise til?

A.For å oppsummere ytelsen til en klassifiseringsmodell.
B.For å evaluere kostnadsfunksjoner.
C.For å analysere regresjonsresultater.
D.For å plotte ROC-kurver.

39. Hva er formålet med evalueringsmetrikker?

A.Å vurdere modellens ytelse og forbedre prediksjoner.
B.Å øke kompleksiteten i modellen.
C.Å fjerne uteliggere fra datasettet.
D.Å beregne datakostnader.

40. Hvordan påvirker datastørrelse modellkompleksitet?

A.Større datasett tillater mer komplekse modeller
B.Større datasett reduserer behovet for kryssvalidering
C.Større datasett krever alltid enklere modeller
D.Større datasett gir lavere nøyaktighet

41. Hva beskriver ROC-kurven?

A.Forholdet mellom sann positiv rate og falsk positiv rate
B.Forholdet mellom nøyaktighet og presisjon
C.Forholdet mellom TP og TN
D.Forholdet mellom FP og FN

42. Hva er forholdet mellom nøyaktighet og feilklassifisering?

A.Nøyaktighet er høy når feilklassifiseringer er lave.
B.Nøyaktighet er uavhengig av feilklassifiseringer.
C.Feilklassifisering reduserer nøyaktighet, men øker presisjon.
D.Nøyaktighet kan være høy selv om feilklassifiseringer er høye.

43. Hva er formelen for R²?

A.R² = 1 - (SS_res / SS_tot)
B.R² = (SS_tot - SS_res) / SS_tot
C.R² = SS_res / SS_tot
D.R² = (SS_tot + SS_res) / SS_tot

44. Hvordan vurderes en modell med høy nøyaktighet i et ubalansert datasett?

A.Den har sannsynligvis god ytelse på alle klasser
B.Den kan være misvisende
C.Den er alltid bedre enn en modell med lav nøyaktighet
D.Den indikerer at alle klasser er like representert

45. Hvilken metrikk brukes til å evaluere ubalanserte datasett?

A.F1-score
B.Nøyaktighet
C.Spesifisitet
D.Konfusjonsmatrise

46. Hvilken av følgende metrikker er mest sensitiv for uteliggere?

A.MSE
B.MAE
C.RMSE
D.R²

47. Hva er kostnadsfunksjon i maskinlæring?

A.En funksjon som evaluerer forskjellen mellom prediksjoner og faktiske resultater.
B.Et mål på hvor mange klasser en modell kan håndtere.
C.En vurdering av nøyaktigheten av en klassifisering.
D.En metode for å forutsi fremtidige data.

48. Hvilken av følgende beskriver korrekt forskjellen mellom presisjon og tilbakekalling?

A.Presisjon vurderer riktigheten av positive prediksjoner, mens tilbakekalling vurderer hvor mange faktiske positive tilfeller som er fanget.
B.De er det samme.
C.Tilbakekalling er viktigere enn presisjon i alle scenarier.
D.Presisjon er bare relevant for regresjonsmodeller.

49. Hva er validitet i konteksten av evalueringsmetrikker?

A.Hvor godt en metrikk måler det den er ment å måle.
B.Andelen av korrekte prediksjoner.
C.En vurdering av kostnaden ved feilklassifisering.
D.Evnen til en modell til å generalisere.

50. Hvilken av følgende metrikker er definert som andelen av negative tilfeller som er korrekt identifisert?

A.Spesifisitet
B.Nøyaktighet
C.Tilbakekalling
D.Falsk positiv rate

Relaterte studiesett

Lag ditt eget studiesett

Last opp en PDF, lim inn notatene dine, eller beskriv et tema – AI genererer flashkort, quizer og mer på sekunder.