övervakad inlärning

Denna begreppslista innehåller centrala termer och koncept relaterade till övervakad inlärning inom maskininlärning och artificiell intelligens, vilket är avgörande för universitetsstudier inom detta område.

Tiger32·60 flashcards·60 frågor
universitetcomputer_scienceai_ml
0
Kan
1 / 60
0
Övar
Framsida

Övervakad inlärning

Tryck för att vända
Baksida

En metod inom maskininlärning där modellen tränas på märkta data, vilket innebär att varje indata har ett motsvarande utdata.

Tryck för att vända
Kan
Övar fortfarande

Quiz(60 frågor)

Fråga 1 av 60

1. Vad innebär övervakad inlärning?

Begrepp i det här studiesetet(60)

Grunder i övervakad inlärning(16)

Övervakad inlärning

En metod inom maskininlärning där modellen tränas på märkta data, vilket innebär att varje indata har ett motsvarande utdata.

Märkt data

Data som har tilldelats specifika etiketter eller värden. Exempel: I en bildklassificering kan en bild av en katt ha etiketten 'katt'.

Träningsdata

Den del av datasetet som används för att träna modellen. Denna data hjälper modellen att lära sig mönster och samband.

Testdata

Data som inte används under träning, utan för att utvärdera modellens prestanda och generaliseringsförmåga.

Algoritm

En uppsättning regler eller instruktioner som en modell följer för att göra förutsägelser. Exempel: linjär regression, beslutsträd.

Regression

En typ av övervakad inlärning där modellen förutsäger kontinuerliga värden. Exempel: Förutsäga bostadspriser baserat på yta.

Klassificering

En metod för att förutsäga kategoriska utdata. Exempel: Att bestämma om en e-post är skräppost eller inte.

Överfitting

En situation där modellen presterar bra på träningsdata men dåligt på testdata. Det beror på för mycket anpassning till träningsdata.

Underfitting

När modellen inte kan fånga mönster i träningsdata, vilket leder till dålig prestanda både på tränings- och testdata.

Korsvalidering

En teknik för att utvärdera modellen genom att dela upp data i flera delar för både träning och testning, vilket ger en mer robust bedömning.

Precision vs Recall

Precision: Andelen korrekt klassificerade positiva exempel. Recall: Andelen verkliga positiva exempel som korrekt identifierades.

Hyperparametrar

Parametrar som ställs in före träning av modellen, t.ex. inlärningshastighet, antal träd i en beslutsträdmodell.

Förlustfunktion

En funktion som mäter hur bra modellen presterar. Minskar när modellen gör korrekta förutsägelser. Exempel: MSE (medelkvadratfel).

Gradientnedstigning

En optimeringsalgoritm som används för att minimera förlustfunktionen genom att justera modellens parametrar i riktning mot den brantaste nedgången.

Ensemblemetoder

Metoder som kombinerar flera modeller för att förbättra prestanda. Exempel: Random Forest och Boosting.

Feature Engineering

Processen att välja, modifiera eller skapa nya variabler för att förbättra modellens förutsägelseförmåga.

Modeller och algoritmer(20)

Linjära modeller

Modeller som använder linjära relationer för att förutsäga utfall. Exempel: linjär regression.

Beslutsstödjande träd

Trädstruktur för klassificering och regression. Dela upp data baserat på attribut.

Vad är logistisk regression?

En statistisk metod för binär klassificering som beräknar sannolikheten för ett utfall.

Stödvektormaskiner (SVM)

Algoritm som söker efter den optimala hyperplanet för att separera klasser i datasatsen.

K-nearest neighbors (KNN)

En icke-parametrisk metod som klassificerar datapunkter baserat på deras närmaste grannar.

Överfitting vs underfitting

Överfitting: modellen anpassar sig för mycket till träningsdata. Underfitting: modellen är för enkel.

Vad är en neuronnät?

En modell inspirerad av biologiska neuron som består av hur många lager som helst av noder.

Random Forest

En ensemblemetod som bygger flera beslutsstödjande träd och sammanfogar deras resultat för att förbättra noggrannheten.

Gradient descent

En optimeringsteknik för att minimera kostnadsfunktioner genom att justera parametrar i motsatt riktning av gradienten.

Fill i det tomma: SVM använder _____ för klassgränser.

hyperplan

True or False: KNN är en parametric method.

False. KNN är icke-parametrisk, vilket innebär att den inte gör antaganden om datadistribution.

Vad står PCA för?

Principal Component Analysis, en teknik för dimensionsreduktion som identifierar de viktigaste variablerna.

Naiv Bayes

En probabilistisk klassificeringsmetod som baseras på Bayes teorem och antagandet om oberoende mellan attribut.

Klassificering vs regression

Klassificering: förutsägelse av kategoriska utfall. Regression: förutsägelse av kontinuerliga värden.

Vad är en kostnadsfunktion?

En funktion som mäter hur bra en modell förutsäger utfall genom att jämföra med verkliga värden.

Vad gör linjär regression?

Förutsäger ett kontinuerligt utfall genom att passa en linje till data för att minimera kostnaden.

Hyperparameter

Parametrar som ställs in innan träning av modellen, till exempel inlärningshastighet i neuronnät.

Bagging och Boosting

Bagging: minskar variansen genom att kombinera modeller. Boosting: förbättrar svaga modeller genom att lägga till dem sekventiellt.

Vad är en klassifikationsrapport?

Ett sammanställning av precision, recall och F1-score som används för att mäta modellens prestanda.

Korsvalidering

En metod för att utvärdera en modells prestanda genom att dela upp data i tränings- och testset flera gånger.

Utvärdering och prestanda(12)

Precision

Andelen korrekt klassificerade positiva exempel i förhållande till alla klassificerade positiva exempel.

Vad mäter recall?

Andelen korrekt klassificerade positiva exempel i förhållande till alla faktiska positiva exempel.

F1-score

Harmonisk medelvärde av precision och recall: F1=2⋅precision⋅recallprecision+recall\displaystyle F1 = 2 \cdot \frac{precision \cdot recall}{precision + recall}.

Verklig positiv och negativ

Verklig positiv: korrekt identifierad. Verklig negativ: korrekt avvisad.

Vad betyder AUC?

Area under the curve; mäter modellens förmåga att skilja mellan klasser vid olika trösklar.

Överanpassning vs. underanpassning

Överanpassning: hög noggrannhet på träning, låg på test. Underanpassning: låg noggrannhet på både.

Korsvalidering

Metod för att utvärdera en modell genom att dela upp data i flera delar för träning och test.

True or False: Hög precision garanterar hög recall.

False: Hög precision kan uppnås med låg recall genom att vara selektiv i positiva klassificeringar.

MSE (Mean Squared Error)

Genomsnittlig kvadrat av skillnaden mellan prognoserade och verkliga värden: MSE=1n∑i=1n(yi−y^i)2\displaystyle MSE = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{y}_i)^2.

Klassificeringsrapport

Sammanfattning av precision, recall och F1-score för varje klass i en modell.

ROC-kurva

Graf som visar förhållandet mellan true positive rate och false positive rate vid olika trösklar.

Fill in the blank: Sensitivitet är synonymt med _____ .

Recall; det mäter också andelen verkliga positiva som korrekt identifieras.

Tillämpningar av övervakad inlärning(12)

Användning av övervakad inlärning i medicin?

Diagnostik av sjukdomar genom analys av patientdata. - Exempel: klassificering av cancer utifrån bilddata.

Vad är en vanlig tillämpning av övervakad inlärning?

Spamfiltrering i e-postsystem. Algoritmer tränas att känna igen mönster i e-postmeddelanden.

Övervakad inlärning i finanssektorn?

Förutsägelse av aktiepriser. Modeller tränas på historiska prisdata och marknadsindikatorer.

True or False: Övervakad inlärning används för osynliga kluster.

False - Övervakad inlärning kräver märkta data för träning.

Fill the blank: Övervakad inlärning används ofta inom _____ för att klassificera bilder.

Datorseende. Används för att identifiera objekt i bilder.

Jämför: Regression vs. Klassificering.

Regression: Förutsäga kontinuerliga värden. Klassificering: Kategorisera data i diskreta klasser.

Exempel på övervakad inlärning i kundservice?

Chatbotar som använder historisk konversationsdata för att förbättra svar och förståelse.

Hur används övervakad inlärning inom transport?

Förutsäga trafikmönster för att optimera ruttplanering. Exempel: GPS-system.

Vad är en användning av övervakad inlärning i sport?

Analys av prestationer och taktik. Exempel: analys av speldata för fotbollslag.

Dataanalys i marknadsföring?

Övervakad inlärning används för att segmentera kunder och förutsäga köpbeslut.

Användning av övervakad inlärning i utbildning?

Anpassade inlärningssystem som anpassar innehåll baserat på elevens prestationer.

Övervakad inlärning i säkerhet?

Riskbedömning och detektering av bedrägerier genom analys av transaktionsdata.

Frågor i det här studiesetet(60)

1. Vad innebär övervakad inlärning?

A.En metod som tränar modeller på märkta data.
B.En teknik för att generera nya data.
C.En algoritm för att optimera hyperparametrar.
D.En process för att rensa datamängder.

2. Vad är syftet med en linjär modell?

A.Att förutsäga utfall baserat på linjära relationer.
B.Att klassificera data i olika kategorier.
C.Att reducera dimensioner i data.
D.Att optimera hyperplan för klassgränser.

3. Vilken tillämpning av övervakad inlärning används för att förutspå kundavhopp?

A.Kundanalys
B.Klassificering av bilder
C.Spamfiltrering
D.Riskbedömning

4. Vad mäter precision i en maskininlärningsmodell?

A.Andelen korrekt klassificerade positiva exempel bland alla klassificerade positiva.
B.Andelen korrekt klassificerade negativa exempel bland alla klassificerade negativa.
C.Andelen faktiska positiva exempel som korrekt klassificerades.
D.Andelen alla exempel som korrekt identifierades.

5. Vad är syftet med träningsdata?

A.Att utvärdera modellens prestanda.
B.Att justera hyperparametrar.
C.Att lära modellen mönster och samband.
D.Att visualisera resultaten.

6. Vilken av följande metoder är en typ av beslutsstödjande träd?

A.K-nearest neighbors
B.Random Forest
C.Logistisk regression
D.Gradient descent

7. Vilket av följande är en tillämpning av övervakad inlärning inom medicinsk bildbehandling?

A.Diagnostik av sjukdomar
B.Segmentering av marknader
C.Förutsäga aktiekurser
D.Optimering av transporter

8. Vad innebär en hög recall i en klassificeringsmodell?

A.Modellen identifierar de flesta verkliga positiva exempel.
B.Modellen har låg andel falskt positiva exempel.
C.Modellen klassificerar flera negativa exempel som positiva.
D.Modellen har låg noggrannhet.

9. Vad är testdata?

A.Data som används för att träna modellen.
B.Data som hjälper till att finjustera hyperparametrar.
C.Data som används för att utvärdera modellens prestanda.
D.Data som används för att skapa nya funktioner.

10. Vad beskriver logistisk regression?

A.En metod för att förutsäga värden i en kontinuerlig skala.
B.En algoritm för att optimera neuronnät.
C.En statistisk metod för binär klassificering.
D.En teknik för att minska överfitting.

11. Vilket av följande är INTE en vanlig tillämpning av övervakad inlärning?

A.Spamfiltrering
B.Kundsegmentering
C.Anonymisering av data
D.Förutsäga väder

12. Vad är F1-score?

A.Harmoniskt medelvärde av precision och recall.
B.Det totala antalet korrekt klassificerade exempel.
C.Skillnaden mellan precision och recall.
D.Summan av noggrannhet och recall.

13. Vilken av följande är en algoritm för övervakad inlärning?

A.Linjär regression
B.K-means klustring
C.Principal Component Analysis
D.K-nearest neighbors

14. Stödvektormaskiner (SVM) används för att:

A.Kluster data i grupper.
B.Separera klasser i en dataset.
C.Utföra dimensionsreduktion.
D.Förutsäga kontinuerliga värden.

15. Vad används övervakad inlärning till i sportanalys?

A.Analysera prestationsdata
B.Optimera träningsprogram
C.Förbättra publiksiffror
D.Skapa spelregler

16. Vilket av följande uttryck definierar verklig negativ?

A.Korrekt avvisad klassificering.
B.Korrekt identifierad positiv klassificering.
C.Felaktigt klassificerad negativ.
D.Korrekt klassificerad osäkerhet.

17. Vilken typ av problem löser klassificering?

A.Förutsägelse av kontinuerliga värden.
B.Förutsägelse av kategoriska utdata.
C.Mönsterigenkänning i stora datamängder.
D.Dataförberedelse för analys.

18. Vilken av följande metoder är icke-parametrisk?

A.K-nearest neighbors
B.Linjär regression
C.Logistisk regression
D.Stödvektormaskiner

19. Vilken typ av modell används för att förutsäga kontinuerliga värden?

A.Regressionsmodell
B.Klassificeringsmodell
C.Clusteringmodell
D.Beslutsmodell

20. Vad betyder AUC i sammanhanget av ROC-kurvor?

A.Area under the curve.
B.Antal underklassade exempel.
C.Förhållande mellan verkliga och falska positiva.
D.Antal korrekt klassificerade negativa exempel.

21. Vad karaktäriserar överfitting?

A.Modellen presterar dåligt på träningsdata.
B.Modellen presterar bra på träningsdata men dåligt på testdata.
C.Modellen generaliserar bra till ny data.
D.Modellen har för få parametrar.

22. Vad innebär överfitting?

A.Modellen är för enkel och kan inte fånga komplexitet.
B.Modellen anpassar sig för mycket till träningsdata.
C.Modellen presterar bra på både tränings- och testdata.
D.Modellen minskar variansen i förutsägelser.

23. Hur används övervakad inlärning för att förbättra kundservice?

A.Genom att skapa automatiserade svar
B.Genom att analysera kunders klagomål
C.Genom att förutsäga framtida trender
D.Genom att träna chatbotar med historisk data

24. Vad kännetecknar överanpassning?

A.Hög noggrannhet på träningsdata men låg noggrannhet på testdata.
B.Låg noggrannhet på både tränings- och testdata.
C.Hög noggrannhet på testdata men låg på träningsdata.
D.Modellen generaliserar väl till nya data.

25. Vilket av följande beskriver underfitting?

A.Modellen har lärt sig mönster för träning men inte testdata.
B.Modellen har för mycket komplexitet.
C.Modellen kan inte fånga mönster i träningsdata.
D.Modellen har hög precision och recall.

26. Vilket av följande beskriver ett neuronnät?

A.En metod för att minimera kostnadsfunktioner.
B.En modell inspirerad av biologiska neuron.
C.En typ av beslutsstödjande träd.
D.En algoritm för klassificering av data.

27. Vilken tillämpning av övervakad inlärning används för trafikprognoser?

A.Optimering av ruttplanering
B.Förbättring av public service
C.Klassificering av meddelanden
D.Segmentering av kunder

28. Vad är korsvalidering?

A.En metod för att utvärdera en modell genom att dela upp data i flera delar.
B.En teknik för att öka datamängden vid träning.
C.En analys av modellens inverkan på olika parametrar.
D.En procedur för att justera modellens hyperparametrar.

29. Vad är syftet med korsvalidering?

A.Att förbereda data för inlärning.
B.Att optimera hyperparametrar.
C.Att utvärdera modellens generaliseringsförmåga.
D.Att öka datamängden.

30. Vad gör random forest?

A.Klassificerar data utifrån närmaste grannar.
B.Skapar en enskild beslutsstödjande träd.
C.Bygger flera träd och kombinerar deras resultat.
D.Optimerar hyperplan för SVM.

31. Vad är syftet med att använda övervakad inlärning i e-postsystem?

A.Att klassificera spam
B.Att öka lagringsutrymmet
C.Att förbättra leveranstider
D.Att identifiera e-postutskick

32. True or False: Hög precision innebär alltid hög recall.

A.False.
B.True.
C.Beroende på datamängden.
D.Bara om modellen är komplex.

33. Vad mäter precision inom övervakad inlärning?

A.Andelen verkliga positiva exempel.
B.Andelen korrekt klassificerade positiva exempel.
C.Andelen falskt positiva exempel.
D.Andelen verkliga negativa exempel.

34. Gradient descent används för att:

A.Maximera kostnadsfunktionen.
B.Minimera kostnadsfunktioner genom justering av parametrar.
C.Klustra data baserat på likhet.
D.Minska antalet dimensioner i en dataset.

35. Hur tillämpas övervakad inlärning inom finanssektorn?

A.För att förutsäga aktiepriser
B.För att skapa budgetar
C.För att analysera marknadsföring
D.För att öka investeringsrisker

36. Vad beskriver MSE (Mean Squared Error)?

A.Genomsnittlig kvadrat av skillnaden mellan prognoserade och verkliga värden.
B.Skillnaden mellan det högsta och lägsta värdet.
C.Totalen av klassificerade exempel.
D.Summan av alla positiva exempel.

37. Vad är hyperparametrar?

A.Parametrar som justeras under träning.
B.Konstanter i förlustfunktionen.
C.Inställningar som fastställs före träning.
D.Data som används för att justera modellen.

38. Vad fyller i tomrummet: SVM använder _____ för klassgränser.

A.datafördelning
B.hyperplan
C.trädstruktur
D.neuron

39. Vilken typ av data används för att träna övervakade modeller?

A.Märkta data
B.Omarkerade data
C.Klusterdata
D.Obehandlade data

40. Vad ingår i en klassificeringsrapport?

A.Sammanfattning av precision, recall och F1-score för varje klass.
B.Bara total noggrannhet för modellen.
C.Endast antalet klassificerade negativa exempel.
D.En graf över träningsdata.

41. Vad är en förlustfunktion?

A.En funktion som mäter hur bra modellen presterar.
B.En metod för att minska mängden data.
C.En algoritm för att optimera hyperparametrar.
D.En teknik för att generera nya datapunkter.

42. Vilken påstående är Falskt om KNN?

A.KNN är icke-parametrisk.
B.KNN kan användas för både klassificering och regression.
C.KNN gör antaganden om datadistribution.
D.KNN klassificerar datapunkter baserat på närmaste grannar.

43. Vad är en tillämpning av övervakad inlärning inom utbildning?

A.Anpassade lärandeplattformar
B.Klassificering av ämnen
C.Analys av studentbetyg
D.Förbättring av läroplaner

44. Vad visar en ROC-kurva?

A.Förhållandet mellan true positive rate och false positive rate.
B.Antalet exempel över olika trösklar.
C.Precision över olika träningsdata.
D.Skillnader mellan olika modeller.

45. Vad gör gradientnedstigning?

A.Minimerar förlustfunktionen.
B.Ökar modellens komplexitet.
C.Identifierar datamönster.
D.Förbättrar datainsamling.

46. Vad står PCA för?

A.Principal Component Analysis
B.Probabilistic Component Adaptation
C.Parametric Classification Algorithm
D.Preliminary Cost Analysis

47. Vilken tillämpning av övervakad inlärning används för att analysera kundernas köpbeteende?

A.Förutsäga köpbeslut genom analys av historiska transaktionsdata.
B.Identifikation av osynliga mönster i data.
C.Skapa bilder baserade på kundernas preferenser.
D.Förbättra sökresultat genom att klassificera webbsidor.

48. Fill in the blank: Sensitivitet är synonymt med _____ .

A.Recall.
B.Precision.
C.F1-score.
D.AUC.

49. Vilken av följande är en ensemblemetod?

A.K-nearest neighbors
B.Linjär regression
C.Random Forest
D.Support Vector Machines

50. Vad är Naiv Bayes?

A.En typ av neuronnät.
B.En probabilistisk klassificeringsmetod.
C.En algoritm för att optimera hyperplan.
D.En metod för klustring.

51. Vad innebär feature engineering?

A.Att samla in data.
B.Att optimera hyperparametrar.
C.Att skapa nya variabler för att förbättra modellen.
D.Att analysera datamängder.

52. Skillnaden mellan klassificering och regression är:

A.Klassificering förutspår kontinuerliga värden, regression för kategoriska.
B.Klassificering förutspår kategoriska utfall, regression för kontinuerliga värden.
C.Båda metoderna används för samma ändamål.
D.Ingen av ovanstående.

53. Vilket av följande alternativ beskriver bäst vad märkt data är?

A.Data som har specifika etiketter eller värden tilldelade.
B.Data som inte har någon struktur.
C.Data som används för att göra förutsägelser utan tidigare information.
D.Data som endast innehåller numeriska värden.

54. Vad beskriver en kostnadsfunktion?

A.Hur bra en modell passar träningsdata.
B.Hur många variabler en modell använder.
C.En algoritm för att optimera en modell.
D.En metod för klustring av data.

55. Vilket av följande scenarier är ett exempel på regression inom övervakad inlärning?

A.Att förutsäga bostadspriser baserat på yta.
B.Att klassificera e-post som skräppost eller inte.
C.Att identifiera objekt i en bild.
D.Att avgöra om en patient har en sjukdom eller inte.

56. Vad gör linjär regression?

A.Förutsäger kontinuerliga värden genom att anpassa en linje till data.
B.Klassificerar data i olika kategorier.
C.Reducerar dimensioner av data.
D.Skapar en ensemble av träd.

57. Vad är en hyperparameter?

A.En parameter som ställs in efter träning av modellen.
B.En parameter som ställs in innan träning av modellen.
C.En typ av klassificeringsmetod.
D.En metod för att utvärdera modellens prestanda.

58. Vad är skillnaden mellan bagging och boosting?

A.Bagging minskar variansen, boosting ökar modellens styrka.
B.Bagging förbättrar enskilda modeller, boosting minskar variansen.
C.Båda metoderna skapar endast en modell.
D.Bagging används endast för klassificering.

59. Vad är en klassificeringsrapport?

A.Ett dokument som beskriver hur man tränar en modell.
B.En sammanställning av precision, recall och F1-score.
C.En metod för att klustra data.
D.En teknik för dimensionsreduktion.

60. Vad är korsvalidering?

A.En metod för att optimera en kostnadsfunktion.
B.En metod för att utvärdera modellens prestanda genom att dela upp data flera gånger.
C.En teknik för att minska komplexiteten i en modell.
D.En algoritm för klassificering.

Relaterade studieset

Skapa ditt eget studieset

Ladda upp en PDF, klistra in dina anteckningar eller beskriv ett ämne – AI genererar flashcards, quiz och mer på några sekunder.