klustring unsupervised learning

Klustring inom osuperviserat lärande är en teknik inom maskininlärning där data grupperas baserat på likheter utan förhandsgiven etikett. Dessa kort hjälper till att förstå begrepp och metoder relaterade till klustring.

OliverFoxrj·48 flashcards·48 frågor
universitetcomputer_scienceai_ml
0
Kan
1 / 48
0
Övar
Framsida

Vad är klustring?

Tryck för att vända
Baksida

Klustring är en metod inom maskininlärning som grupperar data i kluster baserat på likhet.

Tryck för att vända
Kan
Övar fortfarande

Quiz(48 frågor)

Fråga 1 av 48

1. Vad indikerar ett värde nära 0 för Silhouette-koefficienten?

Begrepp i det här studiesetet(48)

Grundläggande begrepp(16)

Vad är klustring?

Klustring är en metod inom maskininlärning som grupperar data i kluster baserat på likhet.

Definiera kluster.

Ett kluster är en grupp av datapunkter som är nära varandra i ett mångdimensionellt rum.

Vad menas med oövervakad inlärning?

Oövervakad inlärning innebär att modellen lär sig mönster i data utan förutbestämda etiketter.

Ge ett exempel på klustring.

Segmentering av kunder baserat på köpbeteenden för att skapa målgruppsanpassade erbjudanden.

Skillnad mellan klustring och klassificering?

Klustring grupperar data utan etiketter, medan klassificering fördelar data i fördefinierade klasser.

Vad är en centroid?

Centroid är det genomsnittliga värdet av alla punkter i ett kluster, en typ av 'medelpunkt'.

Sant eller falskt: Klustring kan endast användas för numeriska data.

Falskt. Klustring kan även användas för kategoriska data, ofta med hjälp av specifika metoder.

Nämn en tillämpning av klustring.

Bildsegmentering inom datorseende för att identifiera objekt i bilder.

Vad är avståndsmetoder?

Avståndsmetoder används för att mäta likhet mellan datapunkter, t.ex. euklidiskt avstånd.

Beskriv 'skalning' i klustring.

Skalning justerar data till ett gemensamt intervall för att förhindra att en variabel dominerar.

Vad syftar 'densitet' till i klustring?

Densitet refererar till hur många datapunkter som finns inom ett visst område i rummet.

Fyll i blanketten: Klustring används för att ________ data.

Gruppera

Vad är en hierarkisk klustring?

En metod som bygger en trädstruktur av kluster, vilket möjliggör att se hur kluster är relaterade.

Nämn en fördel med klustring.

Identifierar dolda strukturer i data som inte är uppenbara vid första anblick.

Vad är klustringsdokumentation?

Dokumentation beskriver hur kluster skapades, vilka metoder som användes och resultaten av analysen.

Vilken roll spelar pre-processing i klustring?

Pre-processing renar och förbereder data för att förbättra klustringens noggrannhet och effektivitet.

Klustringsalgoritmer(16)

K-means algoritm

En populär klustringsalgoritm som delar in data i K kluster baserat på avstånd till medelvärden.

Vad står DBSCAN för?

Density-Based Spatial Clustering of Applications with Noise. Den hittar kluster av varierande form och storlek.

Sann eller falsk: Hierarkisk klustring kräver antalet kluster i förväg.

Falsk - Den bygger en hierarki av kluster och låter användaren välja antalet senare.

Jaccard-similarity används för att...

Mäta likheten mellan två uppsättningar. Används ofta i klustring av diskreta data.

Vad är agglomerativ klustring?

En typ av hierarkisk klustring som börjar med varje punkt som ett eget kluster och slår ihop dem.

Fyll i: I K-means är målet att minimera __________.

Summan av kvadrerade avstånd mellan punkter och deras klustercentra.

Skillnad mellan K-means och K-medoids?

K-means använder medelvärden, medan K-medoids använder faktiska datapunkter som klustercentra.

Vad är fördelen med DBSCAN?

Kan identifiera kluster av olika former och hantera brus i data.

Hierarkisk klustring: två typer?

Agglomerativ och divisiv. Agglomerativ bygger upp, medan divisiv bryter ner.

Vad används silhouette-koefficienten till?

För att mäta hur väl varje punkt passar in i sitt kluster jämfört med andra kluster.

Sann eller falsk: K-means fungerar bra med icke-konvexa kluster.

Falsk - K-means fungerar bäst med konvexa kluster.

Vad är en klustercentra?

En punkt som representerar medelvärdet av alla punkter i ett kluster.

Vilken algoritm är känslig för outliers?

K-means, eftersom avlägsna punkter kan påverka medelvärdet.

Vad används för att bestämma K i K-means?

Elbow-metoden - tittar på varians vs antal kluster.

Vad gör SPN (Shared Nearest Neighbors)?

Identifierar kluster baserat på delade grannar, vilket förbättrar klustringens noggrannhet.

Vad är en nackdel med hierarkisk klustring?

Resurskrävande och kan vara långsam för stora dataset.

Utvärdering av klustring(16)

Vad är Silhouette-koefficienten?

Ett mått på hur väl en punkt är klustrad. Värden nära +1 indikerar bra klustring.

Vad mäter Davies-Bouldin-index?

Mäter klustringskvalitet genom att jämföra kluster med varandra. Lägre värden = bättre klustring.

True or False: Inerti är ett positivt mått.

False. Inerti ska vara så låg som möjligt för att indikera bra klustring.

Vad står förkortningen DB för?

Davies-Bouldin, ett index för klusterutvärdering.

Fyll i: För att utvärdera klustring används _____ och _____ mot varandra.

Inerti och Silhouette-koefficient.

Jaccard-index används för att mäta:

Likhet mellan två kluster. Beräknas som ∣A⋂B∣∣A⋃B∣\displaystyle \frac{|A \bigcap B|}{|A \bigcup B|}.

Vad är en viktig punkt med inerti?

Den ska vara låg. Den representerar total avstånd inom kluster.

Förklara kort: Rand-index.

Ett mått på överensstämmelse mellan två kluster. Jämför verkliga kluster med algoritmens utfall.

Vad är en disadvantage med Silhouette-koefficienten?

Den kan vara känslig för klusterform och storlek.

Vad betyder ett högre värde på Silhouette-koefficienten?

Det indikerar att punkterna är väl separerade och klustrade.

Vilka två aspekter mäter Davies-Bouldin-index?

- Intra-cluster avstånd - Inter-cluster avstånd

Vad är skillnaden mellan Inerti och Silhouette?

Inerti mäter avstånd inom kluster, Silhouette mäter både inre och yttre relationer.

Ge ett exempel på hur Jaccard-index används.

Används för att jämföra likhet mellan kluster av användare baserat på deras intressen.

Fyll i: En hög Rand-index visar _____.

Hög överensstämmelse mellan kluster.

Vad är en nackdel med Inerti?

Det kan leda till felaktiga slutsatser om klusterstruktur.

Vad indikerar ett lågt Davies-Bouldin-index?

Det visar på klart definierade kluster med stor separation.

Frågor i det här studiesetet(48)

1. Vad indikerar ett värde nära 0 för Silhouette-koefficienten?

A.Punkter är dåligt klustrade
B.Punkter är väl klustrade
C.Kluster är överlappande
D.Inga kluster finns

2. Vad är syftet med klustring inom maskininlärning?

A.Att gruppera liknande datapunkter
B.Att klassificera data i fördefinierade klasser
C.Att förutsäga framtida värden
D.Att rensa data från brus

3. Vad är huvudsyftet med K-means algoritm?

A.Att dela in data i K kluster baserat på avstånd till medelvärden.
B.Att klassificera data i förutbestämda kategorier.
C.Att skapa en hierarkisk struktur av kluster.
D.Att optimera en linjär regression.

4. Vilken av följande är inte ett klusterutvärderingsmått?

A.Silhouette-koefficient
B.Davies-Bouldin-index
C.Inerti
D.Användartyp

5. Vilket av följande beskriver bäst en centroid?

A.En punkt som representerar medelvärdet av ett kluster
B.En datapunkt med maximal avvikelse
C.En metod för avståndsmätning
D.En typ av klustringsalgoritm

6. Vad kännetecknar DBSCAN?

A.Det kräver att antalet kluster är förutbestämt.
B.Det kan hantera och identifiera kluster av varierande form och storlek.
C.Det fokuserar endast på linjära kluster.
D.Det använder alltid medelvärden som klustercentra.

7. Vad används Inerti för att mäta?

A.Avstånd mellan kluster
B.Avstånd inom kluster
C.Överensstämmelse mellan kluster
D.Antal kluster

8. Vilket av följande är ett exempel på oövervakad inlärning?

A.Klassificering av bilder
B.Klustring av kunddata
C.Förutsäga aktiekurser
D.Regressionsanalys

9. Sann eller falsk: K-means kan effektivt hantera icke-konvexa kluster.

A.Sann
B.Falsk
C.Beroende på datamängden
D.Endast i vissa fall.

10. Vilket av följande index mäter likhet mellan kluster?

A.Silhouette-koefficient
B.Jaccard-index
C.Davies-Bouldin-index
D.Inerti

11. Vad är skillnaden mellan klustring och klassificering?

A.Klustring använder etiketter, klassificering gör det inte
B.Klustring är alltid mer exakt
C.Klustring grupperar utan etiketter, klassificering använder etiketter
D.Klustring kan endast användas med numeriska data

12. Vad används silhouette-koefficienten till?

A.För att mäta likheten mellan olika dataset.
B.För att bestämma antalet kluster i K-means.
C.För att mäta hur väl varje punkt passar in i sitt kluster.
D.För att identifiera brus i data.

13. Vad innebär ett lågt värde på Davies-Bouldin-index?

A.Kluster är dåligt definierade
B.Kluster är överlappande
C.Kluster har stor separation
D.Kluster har låg kvalitet

14. Vilken av följande metoder används för att mäta avstånd mellan datapunkter?

A.Euklidiskt avstånd
B.Skalning
C.Normalisering
D.Klassificering

15. Vad är agglomerativ klustring?

A.En klustring som alltid kräver ett fördefinierat antal kluster.
B.En hierarkisk klustring som bygger kluster uppifrån.
C.En metod som börjar med varje datapunkt som ett kluster och slår ihop dem.
D.En teknik som alltid använder medelvärden som klustercentra.

16. Vad är en fördel med Silhouette-koefficienten?

A.Mäter bara inre klusteravstånd
B.Visar klusterform och storlek
C.Ger information om kluster separering
D.Är lätt att beräkna

17. Vad innebär densitet i klustring?

A.Antalet datapunkter inom ett givet område
B.Förhållandet mellan kluster och uteliggare
C.Det genomsnittliga avståndet mellan datapunkter
D.En typ av klustringsalgoritm

18. Vilken algoritm är mest känslig för outliers?

A.DBSCAN
B.K-medoids
C.Hierarkisk klustring
D.K-means

19. Vad är den primära nackdelen med Davies-Bouldin-index?

A.Den är komplex att beräkna
B.Den kan ge missvisande resultat
C.Den är känslig för klusterstorlek
D.Den tar inte hänsyn till avstånd

20. Vad händer om data inte skalas innan klustring?

A.Klustringen kan bli snedvriden
B.Datan kommer att förlora sin betydelse
C.Klustring blir enklare
D.Det finns ingen påverkan

21. Vad står K i K-means för?

A.Kvalitet
B.Kluster
C.Kombination
D.Kvantitet

22. Vad visar ett högre värde på Rand-index?

A.Låg överensstämmelse mellan kluster
B.Hög överensstämmelse mellan kluster
C.Oklart klusterförhållande
D.Inga kluster definierade

23. Vad karakteriserar en hierarkisk klustring?

A.Bygger en trädstruktur av kluster
B.Använder endast numeriska data
C.Är en typ av övervakad inlärning
D.Skapar slumpmässiga kluster

24. Vilken metod används för att bestämma det optimala värdet av K i K-means?

A.Silhouette-metoden.
B.Elbow-metoden.
C.Hierarkisk klustring.
D.Agglomerativ klustring.

25. Vilket av följande är en nackdel med Inerti?

A.Det tar inte hänsyn till klusterform
B.Det är för lätt att beräkna
C.Det utvärderar endast ett kluster
D.Det mäter klusteravstånd noggrant

26. Vilken av följande är en tillämpning av klustring?

A.Segmentering av marknader
B.Klassificering av e-post
C.Regressionsanalys
D.Felsökning av programvara

27. Vad är fördelen med att använda K-medoids istället för K-means?

A.Det är alltid snabbare.
B.Det är mindre känsligt för outliers.
C.Det är enklare att implementera.
D.Det fungerar bättre med stora datamängder.

28. Vad representerar ett högt värde på Silhouette-koefficienten?

A.Dålig klustring
B.Bra klustring
C.Inga kluster
D.Överlappar kluster

29. Vad är en typisk användning av klustringsdokumentation?

A.För att beskriva klusteranalysens metoder och resultat
B.För att utveckla nya algoritmer
C.För att optimera datainsamlingen
D.För att skapa visuella diagram

30. Vilken typ av klustring använder medelvärden för att definiera klustercentra?

A.K-medoids
B.Hierarkisk klustring
C.K-means
D.Agglomerativ klustring.

31. Vad innebär Jaccard-indexet?

A.Antal kluster dividerat med total
B.Sannolikhet för kluster
C.Förhållande mellan gemensamma och totala element
D.Mätt avstånd mellan kluster

32. Vilket av följande är INTE en typ av klustringsmetod?

A.K-means
B.DBSCAN
C.Hierarkisk klustring
D.Linjär regression

33. Vad är en nackdel med hierarkisk klustring?

A.Det är alltid mer exakt än andra metoder.
B.Det är mindre resurskrävande än K-means.
C.Det kräver alltid fördefinierat antal kluster.
D.Det kan vara resurskrävande och långsamt för stora dataset.

34. Vilken av följande faktorer påverkar Silhouette-koefficienten?

A.Klusterantal
B.Klusterstorlek
C.Klusterform
D.Alla ovanstående

35. Vad är en fördel med klustring?

A.Identifierar dolda mönster i data
B.Ökar datans noggrannhet
C.Klassificerar alla datapunkter automatiskt
D.Eliminerar brus från data

36. Vilken klustringsteknik bygger en hierarkisk struktur av kluster?

A.K-means
B.DBSCAN
C.Hierarkisk klustring
D.K-medoids.

37. Vad mäter Rand-indexet?

A.Antal kluster
B.Överensstämmelse mellan kluster
C.Kvalitet av kluster
D.Separering av kluster

38. Vilken roll spelar pre-processing i klustring?

A.Förbereder och renar data för klustring
B.Klassificerar data
C.Skapar kluster automatiskt
D.Mäter avstånd mellan datapunkter

39. Vad används Jaccard-similarity för?

A.Att mäta avstånd mellan kluster.
B.Att mäta likheten mellan två uppsättningar.
C.Att optimera klusterplacering.
D.Att beräkna medelvärden av kluster.

40. Vad används för att utvärdera klustring?

A.Endast Inerti
B.Bara Silhouette-koefficient
C.Flera mått inklusive Inerti och Silhouette
D.Endast Davies-Bouldin

41. Vad är en egenskap hos kluster?

A.De är alltid lika stora
B.De har alltid samma form
C.De kan variera i storlek och densitet
D.De kan endast innehålla numeriska datapunkter

42. Vad innebär divisiv klustring?

A.Den bygger upp kluster från enskilda datapunkter.
B.Den bryter ner stora kluster till mindre.
C.Den kräver att antalet kluster är förutbestämt.
D.Den använder alltid medelvärden som klustercentra.

43. Vad är en av huvudpunkterna i Jaccard-index?

A.Den är alltid positiv
B.Den jämför två kluster
C.Den används endast för stora kluster
D.Den är oberoende av klusterstorlek

44. Vad innebär det att använda en avståndsmetod i klustring?

A.Att mäta avstånd mellan kluster
B.Att bestämma likheten mellan datapunkter
C.Att sortera data
D.Att eliminera outliers

45. Vad gör Shared Nearest Neighbors (SPN)?

A.Det identifierar kluster baserat på avstånd.
B.Det identifierar kluster baserat på delade grannar.
C.Det mäter avstånd mellan kluster.
D.Det optimerar K i K-means.

46. Vad innebär ett högt värde för Davies-Bouldin-index?

A.Kluster är klart definierade
B.Kluster är dåligt separerade
C.Kluster är av hög kvalitet
D.Kluster är små

47. Vilket av följande alternativ beskriver bäst vad som händer vid klustring av data?

A.Data grupperas baserat på likhet.
B.Data delas upp i fördefinierade klasser.
C.Data skrivs över för att passa en viss modell.
D.Data reduceras till en dimension.

48. Vilket av följande är INTE en klustringsalgoritm?

A.K-means
B.DBSCAN
C.Agglomerativ klustring
D.Linjär regression.

Relaterade studieset

Skapa ditt eget studieset

Ladda upp en PDF, klistra in dina anteckningar eller beskriv ett ämne – AI genererar flashcards, quiz och mer på några sekunder.