k-Means Clusteranalyse: Einfach erklärt numiqo https://www.youtube.com/watch?v=_IPeE7nAjMo Transkript (automatisch erstellt) 0:01 Hallo, in diesem Video möchte ich dir auf einfache Weise die Kans Clusteranalyse erklären. Zuerst komme ich zu der Frage, was ist die Kme 0:10 Clusteranalyse und wie funktioniert sie? Anschließend zeige ich dir dann noch, wie du die Kmeans Clusteranalyse ganz einfach online mit Datat berechnen 0:19 kannst. Mein Name ist Matthias und ich bin der Gründer von Datat. Und jetzt geht's los. Also die erste Frage, die du dir sicherlich stellst, ist was ist 0:29 überhaupt die Kmin Clusteranalyse? Die Kme Clusteranalyse ist eine der einfachsten und gängigsten Verfahren zur Klusteranalyse. Das Kins Verfahren 0:39 klastert deine Datenpunkte auf eine vorgegebene Anzahl von Klastern. Also, du musst vorab wissen, wie viel Klaster du haben möchtest, dazu aber später 0:49 mehr. Die Ausgangssituation ist nun folgende. Wir haben einen Datensatz und diesen Datensatz möchten wir gerne in Klaster unterteilen. 0:59 Also, wir haben unseren Ausgangsdatensatz und diesen Datensatz möchten wir nun gerne klustern. Nun kommen wir zu der Frage, wie 1:08 funktioniert die Kmin Clusteranalyse? Die Kins Clusteranalyse kann man in fünf Schritten erklären. Auf jeden dieser einzelnen Schritte gehen wir nun genauer 1:17 ein. Am Ende dieser fünf Schritte haben wir dann unseren Ausgangsdatensatz geklastert. Nun starten wir mit dem ersten Punkt, die Anzahl der Klaster 1:27 definieren. Ganz zu Beginn müssen wir erstmal die Anzahl der Klaster definieren, die wir haben möchten. Das ist das K in Kans. 1:37 Also, wenn wir dieses Beispiel hernehmen, kann man schon mit den Augen recht gut erkennen, dass wir eigentlich drei Klaster haben möchten. 1:46 Dementsprechend verwenden wir in diesem Beispiel als k = 3. Also wir möchten am Ende drei Klaster heraushaben. Im zweiten Schritt wird der 1:56 Klastermittelpunkt zufällig festgelegt. Die initialen Klaster werden festgelegt. Dieses geschieht in der Regel zufällig. Also wir legen rein zufällig initial 2:08 unsere drei Punkte in diesen Raum. Also, wir haben drei Klaster ausgewählt. Daher müssen wir drei Klasterzentriids zufällig positionieren. Jedes der 2:19 Klasterzentriids repräsentiert nun ein Klaster. Also jetzt haben wir die Anzahl der Klaster definiert im ersten Schritt und 2:28 im zweiten Schritt haben wir initial die Klasterzentriits zufällig in den Raum positioniert. Und nun können wir zum dritten Schritt übergehen. Im dritten 2:37 Schritt tun wir die jedem Punkt den Klastern zuordnen. Also fangen wir erstmal mit einem Punkt an. Nun wird die Distanz von dem ersten Punkt zu jedem 2:47 der Klaster gemessen. Also, wenn wir hier ein Punkt haben, messen wir die Distanz von diesem Punkt zu jedem Klaster. Anschließend wird der Punkt dem 2:57 Klaster zugeordnet, welcher ihm am nächsten ist. Also hier ist recht klar, dass dieser Punkt dem gelben Klaster am nächsten ist. Also ordnen wir diesen 3:06 Punkt dem gelben Klaster hinzu. Dieses wird nun für alle weiteren Punkte wiederholt. Also jeder Punkt wird einem Klaster zugeordnet. 3:17 Anschließend sind dann alle Punkte initial einem Klaster zugeordnet. Also noch mal, wir haben die Anzahl der Klaster definiert. Wir möchten drei 3:25 Klaster haben. Dann haben wir initial die Klaster Centruids in den Raum positioniert und jetzt im dritten Schritt haben wir alle Punkte einem 3:36 Klaster zugeordnet. Im vierten Schritt berechnen wir nun den Mittelwert von den Klastern. Also im Endeffekt haben wir nun ganz viele grüne Punkte, ganz viele 3:47 rote Punkte und ganz viele gelbe Punkte, welche unsere Klaster repräsentieren. Von diesen Punkten berechnen wir nun jeweils den Mittelwert. Diesen 3:57 Mittelwert verwenden wir dann als neuen Klasterzentriid. Also von jedem Klaster wird der Mittelwert berechnet. Diese Mittelwerte 4:06 sind nun die neuen Klasterzentroids. Es werden also die Klasterzentroids in die Klastermittelpunkte verlegt. Damit kommen wir nun zum nächsten Schritt. Im 4:16 fünften Schritt werden die Punkte den neuen Klastern zugeordnet. Da nun die Zentruits an einen anderen Punkt liegen können, wird wieder jeden Punkt das 4:26 Klaster zugeordnet, welches ihm am nächsten ist. Also, wenn wir hier links schauen, das war unsere Ausgangssituation. 4:33 Nun haben wir aber die Klasterzentruids verschwen. Dementsprechend sind gibt es auch andere Abstände zwischen den Punkten und den Klasterzentriids. Und 4:43 wenn wir nun wieder jeden Punkt dem Klaster zuordnen, welches ihm am nächsten ist, dann erhalten wir das Ergebnis hier auf der rechten Seite. So, 4:52 damit sind wir jetzt eigentlich alle fünf Schritte durch. Nun kommt aber eine letzte Schleife. Also wir wiederholen Schritt 4 und 5. Nun wird Schritt 4 und 5:02 5 so lange wiederholt, bis sich die Klaseraufteilung nicht mehr ändert. Also, was war Schritt 4 und 5 jetzt noch mal? Zuerst wird der Mittelwert von 5:11 jedem Klaster berechnet. Anschließend wird dann der Klaster Zentruid in den Mittelpunkt verlegt und dann werden wieder alle Punkte dem neuen Klaster 5:21 zugeordnet. Wenn sich die Klaster in einer Iteration nicht mehr verändern, ist das Verfahren zu Ende. Also, wenn das der vorige 5:30 Schritt ist, jetzt gehen wir ein Schritt weiter und wir haben wieder die Klaster neu zugeordnet. Ab dieser Schleife wird sich in der nächsten Schleife keiner 5:39 dieser Punkte mehr verändern. Daher ist ab diesem Punkt das Klasterverfahren zu Ende und wir haben unsere Klaster gefunden. Jetzt ist natürlich immer die 5:48 große Frage, welche initialen Klaster werden verwendet? Ein großer Nachteil der Kemans Methode ist, dass das Ergebnis sehr stark davon abhängt, 5:57 welche initialen Klaster verwendet werden. Also, wir haben gesagt, wir haben die Klastermittelpunkte einfach initial zufällig festgelegt. Jetzt kann 6:06 es aber sein, je nachdem wo diese Klastermittelpunkte hinlegt, das unterschiedliche Endergebnisse herauskommen. Um diesen Umstand Rechnung 6:15 zu tragen, wird das ganze Verfahren mehrere Male durchgeführt. Bei jeder der Berechnung werden dann unterschiedliche zufällig gewählte Startpunkte verwendet. 6:25 Anschließend wird dann das Klaster verwendet, welches die kleinsten Summe von Abständen zwischen dem Klastermittelpunkt und den ganzen 6:32 anderen hat. Im Fall von DataTab z.B. wird das ganze Klusterverfahren zehn mal wiederholt und am Ende wird dann das beste Cluster verwendet und dem Nutzer 6:42 präsentiert. Die zweite große Frage ist natürlich, was ist denn nun die optimale Klusteranzahl? Klar ist, mit jedem neuen Klaster wird 6:52 die summierte Abstand in den Klastern kleiner und kleiner. Also schauen wir uns dieses Bild einmal an. Hier haben wir einfach nur zwei Klaster gewählt. 7:01 Wenn wir jetzt von zwei Klaster auf drei Klaster übergehen, können wir natürlich die Datenpunkte besser abbilden. Und vor allem der summierte Abstand von jedem 7:12 Punkt zu dem Klastermittelpunkt ist in diesem Fall natürlich kleiner als in diesem Fall. Daher mit jedem Klaster, was wir zusätzlich hinzunehmen, wird der 7:22 Abstand immer kleiner und kleiner. Am Ende, wenn wir dann gleich viele Klaster wie Punkte haben, ist dieser Abstand natürlich null, aber dieses ist nicht 7:31 zielführend. Jetzt ist dann eben die große Frage, wie viel Klaster sollen verwendet werden? Hierfür kann man die sogenannte 7:38 Lbogenmethode verwenden. Also noch mal, mit jedem zusätzlichen Klaster wird die summierte Abstand zwischen den Punkten und dem Klastermittelpunkt immer 7:47 kleiner. Jedoch gibt es eine Klasteranzahl, ab der jedes zusätzlich Klaster den summierten Abstand nur noch geringfügig 7:56 verkleinert. Dieser Punkt wird als Anzahl der Klaster verwendet. Schauen wir uns das hier einmal an. Also, wenn wir von der Klasteranzahl 1 zur 8:05 Klasteranzahl 2 springen, sehen wir, dass wir einen großen Sprung machen. Also der summierte quadrierte Abstand wird stark reduziert. Genauso von der 8:16 Klasseanzahl 2 zu 3. Jedoch, wenn wir dann von der Klasanzahl 3 zu 4 hinspringen, sehen wir, dass der Abstand nicht mehr so stark reduziert wird, wie 8:26 noch in dem Fall zwischen 2 und 3. Daher wird für diesen Fall die Klasseanzahl 3 verwendet. Daher heißt diese Methode auch Lbogenmethode, weil man sozusagen 8:37 den Lbogen raussucht und dieses dann als Klasteranzahl verwendet. So und nun möchte ich euch noch einmal zeigen, wie ihr die Kme Clusteranalyse 8:47 direkt online mit Datatab berechnen könnt. Dafür gehst du bitte einmal auf datatab.de, de klickst auf den Statistikrechner 8:56 und da wir eine Klasteranalyse machen möchten, klicke bitte einmal auf Klasteranalyse. Hier oben kannst du deine eigenen Daten 9:03 einfügen. Dafür klicke zunächst auf Tabelle Lehren und kopiere dann deine Daten einfach hier rein. Ich verwende nun einfach mal das Beispiel. 9:13 Also, wir wollen eine Klusteranalyse verwenden und wir möchten eine Kans Clusteranalyse verwenden. Sagen wir, wir möchten einen Klaster 9:21 bilden für die Daten Einkommen und Alter. Also wählen wir einfach Einkommen und Alter aus. Hier müssen wir nun auswählen, wie viele Klaster wir haben 9:31 möchten. Wir wählen einfach mal die Zahl 3 aus, also dass wir drei Klaster haben möchten. Und nun berechnet uns Datat die Klusteranalyse. 9:41 Wir sehen hier unsere drei Cluster 1 2 3 mit den jeweiligen Clusterzentroids. Wenn wir nun hier nach unten scrollen, sehen wir die Ellbogenmethode. 9:55 In diesem Fall können wir erkennen, dass wahrscheinlich eigentlich die Anzahl von zwei Klastern perfekt wäre, dadurch dass wir hier einen großen Abfall haben und 10:04 ab dann nur noch einen kleinen Abfall haben. Aber schauen wir uns erstmal für die Anzahl mit drei Klastern die Ergebnisse zu ändern an. 10:14 Hier sehen wir, wie viele Fälle den einzelnen Klastern zugeordnet wurden. Und hier sehen wir dann unser Streudiagramm. 10:21 Hier sehen wir, dass wir hier einmal ein Klaster haben, hier ein Klaster und hier oben ein weiteres Klaster. Zum Schluss sieht man dann noch einmal 10:31 alle Punkte aufgelistet und welchem Klaster die Punkte zugeordnet wurden. Aber wie gesagt, eigentlich kam raus bei der Lbogenmethode, dass wir am besten 10:42 zwei Klaster wählen. Also wählen wir die Anzahl der Klaster mit zwei aus. Und wenn man sich nun Streudiagramm anschaut, kann man auch ganz schön hier 10:52 oben ein Klaster und hier unten das zweite Klaster sehen und hier wieder die Aufteilung der einzelnen Punkte zu den Klasern. 11:01 So, ich hoffe das Video hat dir gefallen. Wenn es dir gefallen hat, würde ich mich über ein Like freuen und wir sehen uns bestimmt bald wieder. Co?