Informatik KI – K-Means und Clustering
Karteikarten zum Thema „Informatik“ · 15 Karten · von atrio. Beispiele: Was ist das Ziel von K-Means Clustering? · Wie funktioniert der K-Means-Algorithmus i…
Karten
15 KartenWas ist das Ziel von K-Means Clustering?
Rückseite
Minimierung der Within-Cluster-Sum-of-Squares (WCSS): Datenpunkte sollen so nah wie möglich an ihrem Cluster-Zentroid liegen.
Wie funktioniert der K-Means-Algorithmus in der Iteration?
Rückseite
Zuweisungsschritt: Punkte dem nächsten Zentroid zuordnen. Aktualisierungsschritt: Zentroiden als Mittelwert aller zugewiesenen Punkte neu berechnen. Wiederholen bis Konvergenz.
Welches Konvergenzkriterium nutzt K-Means standardmäßig?
Rückseite
Algorithmus stoppt, wenn sich Zentroiden zwischen Iterationen nicht mehr ändern oder die maximale Iterationszahl erreicht ist.
Was ist der Unterschied zwischen K-Means und K-Means++ Initialisierung?
Rückseite
K-Means++ wählt Startzentroiden mit Wahrscheinlichkeit proportional zum quadrierten Abstand zu bestehenden Zentroiden – reduziert Risiko schlechter lokaler Optima.
Wozu dient die Elbow-Methode bei K-Means?
Rückseite
Bestimmung der optimalen Clusteranzahl k: WCSS gegen k auftragen, Knick (Ellbogen) im Plot identifiziert sinnvolles k vor abnehmendem Grenznutzen.
Was misst der Silhouette-Score und welchen Wertebereich hat er?
Rückseite
Misst Trennschärfe der Cluster: Werte von -1 bis +1, Werte > 0,5 deuten auf gut getrennte Cluster hin, negative Werte auf Fehlzuordnungen.
Warum ist Feature Scaling vor K-Means essenziell?
Rückseite
K-Means nutzt euklidische Distanz – Features mit großem Wertebereich dominieren die Distanzberechnung und verzerren Clusterbildung.
Nenne drei Hauptnachteile von K-Means Clustering.
Rückseite
Annahme kugelförmiger Clusters, empfindlich gegenüber Ausreißern, erfordert vorherige Festlegung von k, findet nur lokale Optima.
Wie unterscheidet sich DBSCAN fundamental von K-Means?
Rückseite
DBSCAN ist dichtebasiert, benötigt kein k, findet beliebig geformte Cluster, erkennt Ausreißer als Rauschen, Parameter: epsilon und minPts.
Was ist der Unterschied zwischen agglomerativem und divisivem hierarchischem Clustering?
Rückseite
Agglomerativ (bottom-up): Start mit Einzelpunkten, iterative Vereinigung. Divisiv (top-down): Start mit einem Cluster, rekursive Teilung.
Wann nutzt man K-Medoids (PAM) statt K-Means?
Rückseite
Bei kategorialen Daten oder Ausreißern: Medoids sind echte Datenpunkte, robuster gegen Outlier als arithmetische Mittelwerte (Zentroiden).
Was beschreibt die Within-Cluster-Sum-of-Squares (WCSS)?
Rückseite
Summe der quadrierten euklidischen Abstände aller Punkte zu ihrem Cluster-Zentroid – Maß für Kompaktheit der Cluster.
Wie wirkt sich die Wahl der Distanzmetrik auf K-Means aus?
Rückseite
Standard ist euklidische Distanz; Manhattan-Distanz bei hochdimensionalen spärlichen Daten, Kosinus-Distanz bei Text-Clustering (Richtung statt Betrag).
Nenne ein typisches Anwendungsbeispiel für K-Means in der Praxis.
Rückseite
Kundensegmentierung im Marketing: Kunden nach Kaufverhalten und Demografie clustern für gezielte Kampagnen – k entspricht Segmentanzahl.
Was bedeutet 'Inertia' in scikit-learns K-Means-Implementierung?
Rückseite
Inertia entspricht der WCSS – Summe quadrierter Distanzen der Samples zu ihrem nächsten Clusterzentrum. Niedrigere Inertia = kompaktere Cluster.