Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
k-Means Clusteranalyse: Einfach erklärt
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 70 Zeilen
- Hallo, in diesem Video möchte ich dir auf einfache Weise die Kans Clusteranalyse erklären. Zuerst komme ich zu der Frage, was ist die Kme
- Clusteranalyse und wie funktioniert sie? Anschließend zeige ich dir dann noch, wie du die Kmeans Clusteranalyse ganz einfach online mit Datat berechnen
- kannst. Mein Name ist Matthias und ich bin der Gründer von Datat. Und jetzt geht's los. Also die erste Frage, die du dir sicherlich stellst, ist was ist
- überhaupt die Kmin Clusteranalyse? Die Kme Clusteranalyse ist eine der einfachsten und gängigsten Verfahren zur Klusteranalyse. Das Kins Verfahren
- klastert deine Datenpunkte auf eine vorgegebene Anzahl von Klastern. Also, du musst vorab wissen, wie viel Klaster du haben möchtest, dazu aber später
- mehr. Die Ausgangssituation ist nun folgende. Wir haben einen Datensatz und diesen Datensatz möchten wir gerne in Klaster unterteilen.
- Also, wir haben unseren Ausgangsdatensatz und diesen Datensatz möchten wir nun gerne klustern. Nun kommen wir zu der Frage, wie
- funktioniert die Kmin Clusteranalyse? Die Kins Clusteranalyse kann man in fünf Schritten erklären. Auf jeden dieser einzelnen Schritte gehen wir nun genauer
- ein. Am Ende dieser fünf Schritte haben wir dann unseren Ausgangsdatensatz geklastert. Nun starten wir mit dem ersten Punkt, die Anzahl der Klaster
- definieren. Ganz zu Beginn müssen wir erstmal die Anzahl der Klaster definieren, die wir haben möchten. Das ist das K in Kans.
- Also, wenn wir dieses Beispiel hernehmen, kann man schon mit den Augen recht gut erkennen, dass wir eigentlich drei Klaster haben möchten.
- Dementsprechend verwenden wir in diesem Beispiel als k = 3. Also wir möchten am Ende drei Klaster heraushaben. Im zweiten Schritt wird der
- Klastermittelpunkt zufällig festgelegt. Die initialen Klaster werden festgelegt. Dieses geschieht in der Regel zufällig. Also wir legen rein zufällig initial
- unsere drei Punkte in diesen Raum. Also, wir haben drei Klaster ausgewählt. Daher müssen wir drei Klasterzentriids zufällig positionieren. Jedes der
- Klasterzentriids repräsentiert nun ein Klaster. Also jetzt haben wir die Anzahl der Klaster definiert im ersten Schritt und
- im zweiten Schritt haben wir initial die Klasterzentriits zufällig in den Raum positioniert. Und nun können wir zum dritten Schritt übergehen. Im dritten
- Schritt tun wir die jedem Punkt den Klastern zuordnen. Also fangen wir erstmal mit einem Punkt an. Nun wird die Distanz von dem ersten Punkt zu jedem
- der Klaster gemessen. Also, wenn wir hier ein Punkt haben, messen wir die Distanz von diesem Punkt zu jedem Klaster. Anschließend wird der Punkt dem
- Klaster zugeordnet, welcher ihm am nächsten ist. Also hier ist recht klar, dass dieser Punkt dem gelben Klaster am nächsten ist. Also ordnen wir diesen
- Punkt dem gelben Klaster hinzu. Dieses wird nun für alle weiteren Punkte wiederholt. Also jeder Punkt wird einem Klaster zugeordnet.
- Anschließend sind dann alle Punkte initial einem Klaster zugeordnet. Also noch mal, wir haben die Anzahl der Klaster definiert. Wir möchten drei
- Klaster haben. Dann haben wir initial die Klaster Centruids in den Raum positioniert und jetzt im dritten Schritt haben wir alle Punkte einem
- Klaster zugeordnet. Im vierten Schritt berechnen wir nun den Mittelwert von den Klastern. Also im Endeffekt haben wir nun ganz viele grüne Punkte, ganz viele
- rote Punkte und ganz viele gelbe Punkte, welche unsere Klaster repräsentieren. Von diesen Punkten berechnen wir nun jeweils den Mittelwert. Diesen
- Mittelwert verwenden wir dann als neuen Klasterzentriid. Also von jedem Klaster wird der Mittelwert berechnet. Diese Mittelwerte
- sind nun die neuen Klasterzentroids. Es werden also die Klasterzentroids in die Klastermittelpunkte verlegt. Damit kommen wir nun zum nächsten Schritt. Im
- fünften Schritt werden die Punkte den neuen Klastern zugeordnet. Da nun die Zentruits an einen anderen Punkt liegen können, wird wieder jeden Punkt das
- Klaster zugeordnet, welches ihm am nächsten ist. Also, wenn wir hier links schauen, das war unsere Ausgangssituation.
- Nun haben wir aber die Klasterzentruids verschwen. Dementsprechend sind gibt es auch andere Abstände zwischen den Punkten und den Klasterzentriids. Und
- wenn wir nun wieder jeden Punkt dem Klaster zuordnen, welches ihm am nächsten ist, dann erhalten wir das Ergebnis hier auf der rechten Seite. So,
- damit sind wir jetzt eigentlich alle fünf Schritte durch. Nun kommt aber eine letzte Schleife. Also wir wiederholen Schritt 4 und 5. Nun wird Schritt 4 und
- 5 so lange wiederholt, bis sich die Klaseraufteilung nicht mehr ändert. Also, was war Schritt 4 und 5 jetzt noch mal? Zuerst wird der Mittelwert von
- jedem Klaster berechnet. Anschließend wird dann der Klaster Zentruid in den Mittelpunkt verlegt und dann werden wieder alle Punkte dem neuen Klaster
- zugeordnet. Wenn sich die Klaster in einer Iteration nicht mehr verändern, ist das Verfahren zu Ende. Also, wenn das der vorige
- Schritt ist, jetzt gehen wir ein Schritt weiter und wir haben wieder die Klaster neu zugeordnet. Ab dieser Schleife wird sich in der nächsten Schleife keiner
- dieser Punkte mehr verändern. Daher ist ab diesem Punkt das Klasterverfahren zu Ende und wir haben unsere Klaster gefunden. Jetzt ist natürlich immer die
- große Frage, welche initialen Klaster werden verwendet? Ein großer Nachteil der Kemans Methode ist, dass das Ergebnis sehr stark davon abhängt,
- welche initialen Klaster verwendet werden. Also, wir haben gesagt, wir haben die Klastermittelpunkte einfach initial zufällig festgelegt. Jetzt kann
- es aber sein, je nachdem wo diese Klastermittelpunkte hinlegt, das unterschiedliche Endergebnisse herauskommen. Um diesen Umstand Rechnung
- zu tragen, wird das ganze Verfahren mehrere Male durchgeführt. Bei jeder der Berechnung werden dann unterschiedliche zufällig gewählte Startpunkte verwendet.
- Anschließend wird dann das Klaster verwendet, welches die kleinsten Summe von Abständen zwischen dem Klastermittelpunkt und den ganzen
- anderen hat. Im Fall von DataTab z.B. wird das ganze Klusterverfahren zehn mal wiederholt und am Ende wird dann das beste Cluster verwendet und dem Nutzer
- präsentiert. Die zweite große Frage ist natürlich, was ist denn nun die optimale Klusteranzahl? Klar ist, mit jedem neuen Klaster wird
- die summierte Abstand in den Klastern kleiner und kleiner. Also schauen wir uns dieses Bild einmal an. Hier haben wir einfach nur zwei Klaster gewählt.
- Wenn wir jetzt von zwei Klaster auf drei Klaster übergehen, können wir natürlich die Datenpunkte besser abbilden. Und vor allem der summierte Abstand von jedem
- Punkt zu dem Klastermittelpunkt ist in diesem Fall natürlich kleiner als in diesem Fall. Daher mit jedem Klaster, was wir zusätzlich hinzunehmen, wird der
- Abstand immer kleiner und kleiner. Am Ende, wenn wir dann gleich viele Klaster wie Punkte haben, ist dieser Abstand natürlich null, aber dieses ist nicht
- zielführend. Jetzt ist dann eben die große Frage, wie viel Klaster sollen verwendet werden? Hierfür kann man die sogenannte
- Lbogenmethode verwenden. Also noch mal, mit jedem zusätzlichen Klaster wird die summierte Abstand zwischen den Punkten und dem Klastermittelpunkt immer
- kleiner. Jedoch gibt es eine Klasteranzahl, ab der jedes zusätzlich Klaster den summierten Abstand nur noch geringfügig
- verkleinert. Dieser Punkt wird als Anzahl der Klaster verwendet. Schauen wir uns das hier einmal an. Also, wenn wir von der Klasteranzahl 1 zur
- Klasteranzahl 2 springen, sehen wir, dass wir einen großen Sprung machen. Also der summierte quadrierte Abstand wird stark reduziert. Genauso von der
- Klasseanzahl 2 zu 3. Jedoch, wenn wir dann von der Klasanzahl 3 zu 4 hinspringen, sehen wir, dass der Abstand nicht mehr so stark reduziert wird, wie
- noch in dem Fall zwischen 2 und 3. Daher wird für diesen Fall die Klasseanzahl 3 verwendet. Daher heißt diese Methode auch Lbogenmethode, weil man sozusagen
- den Lbogen raussucht und dieses dann als Klasteranzahl verwendet. So und nun möchte ich euch noch einmal zeigen, wie ihr die Kme Clusteranalyse
- direkt online mit Datatab berechnen könnt. Dafür gehst du bitte einmal auf datatab.de, de klickst auf den Statistikrechner
- und da wir eine Klasteranalyse machen möchten, klicke bitte einmal auf Klasteranalyse. Hier oben kannst du deine eigenen Daten
- einfügen. Dafür klicke zunächst auf Tabelle Lehren und kopiere dann deine Daten einfach hier rein. Ich verwende nun einfach mal das Beispiel.
- Also, wir wollen eine Klusteranalyse verwenden und wir möchten eine Kans Clusteranalyse verwenden. Sagen wir, wir möchten einen Klaster
- bilden für die Daten Einkommen und Alter. Also wählen wir einfach Einkommen und Alter aus. Hier müssen wir nun auswählen, wie viele Klaster wir haben
- möchten. Wir wählen einfach mal die Zahl 3 aus, also dass wir drei Klaster haben möchten. Und nun berechnet uns Datat die Klusteranalyse.
- Wir sehen hier unsere drei Cluster 1 2 3 mit den jeweiligen Clusterzentroids. Wenn wir nun hier nach unten scrollen, sehen wir die Ellbogenmethode.
- In diesem Fall können wir erkennen, dass wahrscheinlich eigentlich die Anzahl von zwei Klastern perfekt wäre, dadurch dass wir hier einen großen Abfall haben und
- ab dann nur noch einen kleinen Abfall haben. Aber schauen wir uns erstmal für die Anzahl mit drei Klastern die Ergebnisse zu ändern an.
- Hier sehen wir, wie viele Fälle den einzelnen Klastern zugeordnet wurden. Und hier sehen wir dann unser Streudiagramm.
- Hier sehen wir, dass wir hier einmal ein Klaster haben, hier ein Klaster und hier oben ein weiteres Klaster. Zum Schluss sieht man dann noch einmal
- alle Punkte aufgelistet und welchem Klaster die Punkte zugeordnet wurden. Aber wie gesagt, eigentlich kam raus bei der Lbogenmethode, dass wir am besten
- zwei Klaster wählen. Also wählen wir die Anzahl der Klaster mit zwei aus. Und wenn man sich nun Streudiagramm anschaut, kann man auch ganz schön hier
- oben ein Klaster und hier unten das zweite Klaster sehen und hier wieder die Aufteilung der einzelnen Punkte zu den Klasern.
- So, ich hoffe das Video hat dir gefallen. Wenn es dir gefallen hat, würde ich mich über ein Like freuen und wir sehen uns bestimmt bald wieder. Co?