klustring unsupervised learning
Klustring inom osuperviserat lärande är en teknik inom maskininlärning där data grupperas baserat på likheter utan förhandsgiven etikett. Dessa kort hjälper till att förstå begrepp och metoder relaterade till klustring.
Quiz(48 frågor)
1. Vad indikerar ett värde nära 0 för Silhouette-koefficienten?
Begrepp i det här studiesetet(48)
Grundläggande begrepp(16)
Vad är klustring?
Klustring är en metod inom maskininlärning som grupperar data i kluster baserat på likhet.
Definiera kluster.
Ett kluster är en grupp av datapunkter som är nära varandra i ett mångdimensionellt rum.
Vad menas med oövervakad inlärning?
Oövervakad inlärning innebär att modellen lär sig mönster i data utan förutbestämda etiketter.
Ge ett exempel på klustring.
Segmentering av kunder baserat på köpbeteenden för att skapa målgruppsanpassade erbjudanden.
Skillnad mellan klustring och klassificering?
Klustring grupperar data utan etiketter, medan klassificering fördelar data i fördefinierade klasser.
Vad är en centroid?
Centroid är det genomsnittliga värdet av alla punkter i ett kluster, en typ av 'medelpunkt'.
Sant eller falskt: Klustring kan endast användas för numeriska data.
Falskt. Klustring kan även användas för kategoriska data, ofta med hjälp av specifika metoder.
Nämn en tillämpning av klustring.
Bildsegmentering inom datorseende för att identifiera objekt i bilder.
Vad är avståndsmetoder?
Avståndsmetoder används för att mäta likhet mellan datapunkter, t.ex. euklidiskt avstånd.
Beskriv 'skalning' i klustring.
Skalning justerar data till ett gemensamt intervall för att förhindra att en variabel dominerar.
Vad syftar 'densitet' till i klustring?
Densitet refererar till hur många datapunkter som finns inom ett visst område i rummet.
Fyll i blanketten: Klustring används för att ________ data.
Gruppera
Vad är en hierarkisk klustring?
En metod som bygger en trädstruktur av kluster, vilket möjliggör att se hur kluster är relaterade.
Nämn en fördel med klustring.
Identifierar dolda strukturer i data som inte är uppenbara vid första anblick.
Vad är klustringsdokumentation?
Dokumentation beskriver hur kluster skapades, vilka metoder som användes och resultaten av analysen.
Vilken roll spelar pre-processing i klustring?
Pre-processing renar och förbereder data för att förbättra klustringens noggrannhet och effektivitet.
Klustringsalgoritmer(16)
K-means algoritm
En populär klustringsalgoritm som delar in data i K kluster baserat på avstånd till medelvärden.
Vad står DBSCAN för?
Density-Based Spatial Clustering of Applications with Noise. Den hittar kluster av varierande form och storlek.
Sann eller falsk: Hierarkisk klustring kräver antalet kluster i förväg.
Falsk - Den bygger en hierarki av kluster och låter användaren välja antalet senare.
Jaccard-similarity används för att...
Mäta likheten mellan två uppsättningar. Används ofta i klustring av diskreta data.
Vad är agglomerativ klustring?
En typ av hierarkisk klustring som börjar med varje punkt som ett eget kluster och slår ihop dem.
Fyll i: I K-means är målet att minimera __________.
Summan av kvadrerade avstånd mellan punkter och deras klustercentra.
Skillnad mellan K-means och K-medoids?
K-means använder medelvärden, medan K-medoids använder faktiska datapunkter som klustercentra.
Vad är fördelen med DBSCAN?
Kan identifiera kluster av olika former och hantera brus i data.
Hierarkisk klustring: två typer?
Agglomerativ och divisiv. Agglomerativ bygger upp, medan divisiv bryter ner.
Vad används silhouette-koefficienten till?
För att mäta hur väl varje punkt passar in i sitt kluster jämfört med andra kluster.
Sann eller falsk: K-means fungerar bra med icke-konvexa kluster.
Falsk - K-means fungerar bäst med konvexa kluster.
Vad är en klustercentra?
En punkt som representerar medelvärdet av alla punkter i ett kluster.
Vilken algoritm är känslig för outliers?
K-means, eftersom avlägsna punkter kan påverka medelvärdet.
Vad används för att bestämma K i K-means?
Elbow-metoden - tittar på varians vs antal kluster.
Vad gör SPN (Shared Nearest Neighbors)?
Identifierar kluster baserat på delade grannar, vilket förbättrar klustringens noggrannhet.
Vad är en nackdel med hierarkisk klustring?
Resurskrävande och kan vara långsam för stora dataset.
Utvärdering av klustring(16)
Vad är Silhouette-koefficienten?
Ett mått på hur väl en punkt är klustrad. Värden nära +1 indikerar bra klustring.
Vad mäter Davies-Bouldin-index?
Mäter klustringskvalitet genom att jämföra kluster med varandra. Lägre värden = bättre klustring.
True or False: Inerti är ett positivt mått.
False. Inerti ska vara så låg som möjligt för att indikera bra klustring.
Vad står förkortningen DB för?
Davies-Bouldin, ett index för klusterutvärdering.
Fyll i: För att utvärdera klustring används _____ och _____ mot varandra.
Inerti och Silhouette-koefficient.
Jaccard-index används för att mäta:
Likhet mellan två kluster. Beräknas som .
Vad är en viktig punkt med inerti?
Den ska vara låg. Den representerar total avstånd inom kluster.
Förklara kort: Rand-index.
Ett mått på överensstämmelse mellan två kluster. Jämför verkliga kluster med algoritmens utfall.
Vad är en disadvantage med Silhouette-koefficienten?
Den kan vara känslig för klusterform och storlek.
Vad betyder ett högre värde på Silhouette-koefficienten?
Det indikerar att punkterna är väl separerade och klustrade.
Vilka två aspekter mäter Davies-Bouldin-index?
- Intra-cluster avstånd - Inter-cluster avstånd
Vad är skillnaden mellan Inerti och Silhouette?
Inerti mäter avstånd inom kluster, Silhouette mäter både inre och yttre relationer.
Ge ett exempel på hur Jaccard-index används.
Används för att jämföra likhet mellan kluster av användare baserat på deras intressen.
Fyll i: En hög Rand-index visar _____.
Hög överensstämmelse mellan kluster.
Vad är en nackdel med Inerti?
Det kan leda till felaktiga slutsatser om klusterstruktur.
Vad indikerar ett lågt Davies-Bouldin-index?
Det visar på klart definierade kluster med stor separation.
Frågor i det här studiesetet(48)
1. Vad indikerar ett värde nära 0 för Silhouette-koefficienten?
2. Vad är syftet med klustring inom maskininlärning?
3. Vad är huvudsyftet med K-means algoritm?
4. Vilken av följande är inte ett klusterutvärderingsmått?
5. Vilket av följande beskriver bäst en centroid?
6. Vad kännetecknar DBSCAN?
7. Vad används Inerti för att mäta?
8. Vilket av följande är ett exempel på oövervakad inlärning?
9. Sann eller falsk: K-means kan effektivt hantera icke-konvexa kluster.
10. Vilket av följande index mäter likhet mellan kluster?
11. Vad är skillnaden mellan klustring och klassificering?
12. Vad används silhouette-koefficienten till?
13. Vad innebär ett lågt värde på Davies-Bouldin-index?
14. Vilken av följande metoder används för att mäta avstånd mellan datapunkter?
15. Vad är agglomerativ klustring?
16. Vad är en fördel med Silhouette-koefficienten?
17. Vad innebär densitet i klustring?
18. Vilken algoritm är mest känslig för outliers?
19. Vad är den primära nackdelen med Davies-Bouldin-index?
20. Vad händer om data inte skalas innan klustring?
21. Vad står K i K-means för?
22. Vad visar ett högre värde på Rand-index?
23. Vad karakteriserar en hierarkisk klustring?
24. Vilken metod används för att bestämma det optimala värdet av K i K-means?
25. Vilket av följande är en nackdel med Inerti?
26. Vilken av följande är en tillämpning av klustring?
27. Vad är fördelen med att använda K-medoids istället för K-means?
28. Vad representerar ett högt värde på Silhouette-koefficienten?
29. Vad är en typisk användning av klustringsdokumentation?
30. Vilken typ av klustring använder medelvärden för att definiera klustercentra?
31. Vad innebär Jaccard-indexet?
32. Vilket av följande är INTE en typ av klustringsmetod?
33. Vad är en nackdel med hierarkisk klustring?
34. Vilken av följande faktorer påverkar Silhouette-koefficienten?
35. Vad är en fördel med klustring?
36. Vilken klustringsteknik bygger en hierarkisk struktur av kluster?
37. Vad mäter Rand-indexet?
38. Vilken roll spelar pre-processing i klustring?
39. Vad används Jaccard-similarity för?
40. Vad används för att utvärdera klustring?
41. Vad är en egenskap hos kluster?
42. Vad innebär divisiv klustring?
43. Vad är en av huvudpunkterna i Jaccard-index?
44. Vad innebär det att använda en avståndsmetod i klustring?
45. Vad gör Shared Nearest Neighbors (SPN)?
46. Vad innebär ett högt värde för Davies-Bouldin-index?
47. Vilket av följande alternativ beskriver bäst vad som händer vid klustring av data?
48. Vilket av följande är INTE en klustringsalgoritm?
Relaterade studieset
k-Means Clustering Karteikarten
Backpropagation neuronale Netze Prüfungsfragen
Entscheidungsbäume Machine Learning Klausurvorbereitung
Überwachtes und unüberwachtes Lernen Prüfungsfragen
Abitur neuronales Netz Idee
Test: KI und ein normales Programm
Trainingsdaten und Bias Notizen
Transformer und Large Language Models Klausurvorbereitung
Skapa ditt eget studieset
Ladda upp en PDF, klistra in dina anteckningar eller beskriv ett ämne – AI genererar flashcards, quiz och mer på några sekunder.

