Zum Inhalt springen
L

Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).

k-Means Clusteranalyse: Einfach erklärt

numiqo11:11 36.791 Aufrufe veröffentlicht Auf YouTube

Das Wichtigste aus dem Video

Tipp auf eine Zeit – das Video springt genau dorthin.

Transkriptautomatisch erstellt · 70 Zeilen
Herunterladen
  1. Hallo, in diesem Video möchte ich dir auf einfache Weise die Kans Clusteranalyse erklären. Zuerst komme ich zu der Frage, was ist die Kme
  2. Clusteranalyse und wie funktioniert sie? Anschließend zeige ich dir dann noch, wie du die Kmeans Clusteranalyse ganz einfach online mit Datat berechnen
  3. kannst. Mein Name ist Matthias und ich bin der Gründer von Datat. Und jetzt geht's los. Also die erste Frage, die du dir sicherlich stellst, ist was ist
  4. überhaupt die Kmin Clusteranalyse? Die Kme Clusteranalyse ist eine der einfachsten und gängigsten Verfahren zur Klusteranalyse. Das Kins Verfahren
  5. klastert deine Datenpunkte auf eine vorgegebene Anzahl von Klastern. Also, du musst vorab wissen, wie viel Klaster du haben möchtest, dazu aber später
  6. mehr. Die Ausgangssituation ist nun folgende. Wir haben einen Datensatz und diesen Datensatz möchten wir gerne in Klaster unterteilen.
  7. Also, wir haben unseren Ausgangsdatensatz und diesen Datensatz möchten wir nun gerne klustern. Nun kommen wir zu der Frage, wie
  8. funktioniert die Kmin Clusteranalyse? Die Kins Clusteranalyse kann man in fünf Schritten erklären. Auf jeden dieser einzelnen Schritte gehen wir nun genauer
  9. ein. Am Ende dieser fünf Schritte haben wir dann unseren Ausgangsdatensatz geklastert. Nun starten wir mit dem ersten Punkt, die Anzahl der Klaster
  10. definieren. Ganz zu Beginn müssen wir erstmal die Anzahl der Klaster definieren, die wir haben möchten. Das ist das K in Kans.
  11. Also, wenn wir dieses Beispiel hernehmen, kann man schon mit den Augen recht gut erkennen, dass wir eigentlich drei Klaster haben möchten.
  12. Dementsprechend verwenden wir in diesem Beispiel als k = 3. Also wir möchten am Ende drei Klaster heraushaben. Im zweiten Schritt wird der
  13. Klastermittelpunkt zufällig festgelegt. Die initialen Klaster werden festgelegt. Dieses geschieht in der Regel zufällig. Also wir legen rein zufällig initial
  14. unsere drei Punkte in diesen Raum. Also, wir haben drei Klaster ausgewählt. Daher müssen wir drei Klasterzentriids zufällig positionieren. Jedes der
  15. Klasterzentriids repräsentiert nun ein Klaster. Also jetzt haben wir die Anzahl der Klaster definiert im ersten Schritt und
  16. im zweiten Schritt haben wir initial die Klasterzentriits zufällig in den Raum positioniert. Und nun können wir zum dritten Schritt übergehen. Im dritten
  17. Schritt tun wir die jedem Punkt den Klastern zuordnen. Also fangen wir erstmal mit einem Punkt an. Nun wird die Distanz von dem ersten Punkt zu jedem
  18. der Klaster gemessen. Also, wenn wir hier ein Punkt haben, messen wir die Distanz von diesem Punkt zu jedem Klaster. Anschließend wird der Punkt dem
  19. Klaster zugeordnet, welcher ihm am nächsten ist. Also hier ist recht klar, dass dieser Punkt dem gelben Klaster am nächsten ist. Also ordnen wir diesen
  20. Punkt dem gelben Klaster hinzu. Dieses wird nun für alle weiteren Punkte wiederholt. Also jeder Punkt wird einem Klaster zugeordnet.
  21. Anschließend sind dann alle Punkte initial einem Klaster zugeordnet. Also noch mal, wir haben die Anzahl der Klaster definiert. Wir möchten drei
  22. Klaster haben. Dann haben wir initial die Klaster Centruids in den Raum positioniert und jetzt im dritten Schritt haben wir alle Punkte einem
  23. Klaster zugeordnet. Im vierten Schritt berechnen wir nun den Mittelwert von den Klastern. Also im Endeffekt haben wir nun ganz viele grüne Punkte, ganz viele
  24. rote Punkte und ganz viele gelbe Punkte, welche unsere Klaster repräsentieren. Von diesen Punkten berechnen wir nun jeweils den Mittelwert. Diesen
  25. Mittelwert verwenden wir dann als neuen Klasterzentriid. Also von jedem Klaster wird der Mittelwert berechnet. Diese Mittelwerte
  26. sind nun die neuen Klasterzentroids. Es werden also die Klasterzentroids in die Klastermittelpunkte verlegt. Damit kommen wir nun zum nächsten Schritt. Im
  27. fünften Schritt werden die Punkte den neuen Klastern zugeordnet. Da nun die Zentruits an einen anderen Punkt liegen können, wird wieder jeden Punkt das
  28. Klaster zugeordnet, welches ihm am nächsten ist. Also, wenn wir hier links schauen, das war unsere Ausgangssituation.
  29. Nun haben wir aber die Klasterzentruids verschwen. Dementsprechend sind gibt es auch andere Abstände zwischen den Punkten und den Klasterzentriids. Und
  30. wenn wir nun wieder jeden Punkt dem Klaster zuordnen, welches ihm am nächsten ist, dann erhalten wir das Ergebnis hier auf der rechten Seite. So,
  31. damit sind wir jetzt eigentlich alle fünf Schritte durch. Nun kommt aber eine letzte Schleife. Also wir wiederholen Schritt 4 und 5. Nun wird Schritt 4 und
  32. 5 so lange wiederholt, bis sich die Klaseraufteilung nicht mehr ändert. Also, was war Schritt 4 und 5 jetzt noch mal? Zuerst wird der Mittelwert von
  33. jedem Klaster berechnet. Anschließend wird dann der Klaster Zentruid in den Mittelpunkt verlegt und dann werden wieder alle Punkte dem neuen Klaster
  34. zugeordnet. Wenn sich die Klaster in einer Iteration nicht mehr verändern, ist das Verfahren zu Ende. Also, wenn das der vorige
  35. Schritt ist, jetzt gehen wir ein Schritt weiter und wir haben wieder die Klaster neu zugeordnet. Ab dieser Schleife wird sich in der nächsten Schleife keiner
  36. dieser Punkte mehr verändern. Daher ist ab diesem Punkt das Klasterverfahren zu Ende und wir haben unsere Klaster gefunden. Jetzt ist natürlich immer die
  37. große Frage, welche initialen Klaster werden verwendet? Ein großer Nachteil der Kemans Methode ist, dass das Ergebnis sehr stark davon abhängt,
  38. welche initialen Klaster verwendet werden. Also, wir haben gesagt, wir haben die Klastermittelpunkte einfach initial zufällig festgelegt. Jetzt kann
  39. es aber sein, je nachdem wo diese Klastermittelpunkte hinlegt, das unterschiedliche Endergebnisse herauskommen. Um diesen Umstand Rechnung
  40. zu tragen, wird das ganze Verfahren mehrere Male durchgeführt. Bei jeder der Berechnung werden dann unterschiedliche zufällig gewählte Startpunkte verwendet.
  41. Anschließend wird dann das Klaster verwendet, welches die kleinsten Summe von Abständen zwischen dem Klastermittelpunkt und den ganzen
  42. anderen hat. Im Fall von DataTab z.B. wird das ganze Klusterverfahren zehn mal wiederholt und am Ende wird dann das beste Cluster verwendet und dem Nutzer
  43. präsentiert. Die zweite große Frage ist natürlich, was ist denn nun die optimale Klusteranzahl? Klar ist, mit jedem neuen Klaster wird
  44. die summierte Abstand in den Klastern kleiner und kleiner. Also schauen wir uns dieses Bild einmal an. Hier haben wir einfach nur zwei Klaster gewählt.
  45. Wenn wir jetzt von zwei Klaster auf drei Klaster übergehen, können wir natürlich die Datenpunkte besser abbilden. Und vor allem der summierte Abstand von jedem
  46. Punkt zu dem Klastermittelpunkt ist in diesem Fall natürlich kleiner als in diesem Fall. Daher mit jedem Klaster, was wir zusätzlich hinzunehmen, wird der
  47. Abstand immer kleiner und kleiner. Am Ende, wenn wir dann gleich viele Klaster wie Punkte haben, ist dieser Abstand natürlich null, aber dieses ist nicht
  48. zielführend. Jetzt ist dann eben die große Frage, wie viel Klaster sollen verwendet werden? Hierfür kann man die sogenannte
  49. Lbogenmethode verwenden. Also noch mal, mit jedem zusätzlichen Klaster wird die summierte Abstand zwischen den Punkten und dem Klastermittelpunkt immer
  50. kleiner. Jedoch gibt es eine Klasteranzahl, ab der jedes zusätzlich Klaster den summierten Abstand nur noch geringfügig
  51. verkleinert. Dieser Punkt wird als Anzahl der Klaster verwendet. Schauen wir uns das hier einmal an. Also, wenn wir von der Klasteranzahl 1 zur
  52. Klasteranzahl 2 springen, sehen wir, dass wir einen großen Sprung machen. Also der summierte quadrierte Abstand wird stark reduziert. Genauso von der
  53. Klasseanzahl 2 zu 3. Jedoch, wenn wir dann von der Klasanzahl 3 zu 4 hinspringen, sehen wir, dass der Abstand nicht mehr so stark reduziert wird, wie
  54. noch in dem Fall zwischen 2 und 3. Daher wird für diesen Fall die Klasseanzahl 3 verwendet. Daher heißt diese Methode auch Lbogenmethode, weil man sozusagen
  55. den Lbogen raussucht und dieses dann als Klasteranzahl verwendet. So und nun möchte ich euch noch einmal zeigen, wie ihr die Kme Clusteranalyse
  56. direkt online mit Datatab berechnen könnt. Dafür gehst du bitte einmal auf datatab.de, de klickst auf den Statistikrechner
  57. und da wir eine Klasteranalyse machen möchten, klicke bitte einmal auf Klasteranalyse. Hier oben kannst du deine eigenen Daten
  58. einfügen. Dafür klicke zunächst auf Tabelle Lehren und kopiere dann deine Daten einfach hier rein. Ich verwende nun einfach mal das Beispiel.
  59. Also, wir wollen eine Klusteranalyse verwenden und wir möchten eine Kans Clusteranalyse verwenden. Sagen wir, wir möchten einen Klaster
  60. bilden für die Daten Einkommen und Alter. Also wählen wir einfach Einkommen und Alter aus. Hier müssen wir nun auswählen, wie viele Klaster wir haben
  61. möchten. Wir wählen einfach mal die Zahl 3 aus, also dass wir drei Klaster haben möchten. Und nun berechnet uns Datat die Klusteranalyse.
  62. Wir sehen hier unsere drei Cluster 1 2 3 mit den jeweiligen Clusterzentroids. Wenn wir nun hier nach unten scrollen, sehen wir die Ellbogenmethode.
  63. In diesem Fall können wir erkennen, dass wahrscheinlich eigentlich die Anzahl von zwei Klastern perfekt wäre, dadurch dass wir hier einen großen Abfall haben und
  64. ab dann nur noch einen kleinen Abfall haben. Aber schauen wir uns erstmal für die Anzahl mit drei Klastern die Ergebnisse zu ändern an.
  65. Hier sehen wir, wie viele Fälle den einzelnen Klastern zugeordnet wurden. Und hier sehen wir dann unser Streudiagramm.
  66. Hier sehen wir, dass wir hier einmal ein Klaster haben, hier ein Klaster und hier oben ein weiteres Klaster. Zum Schluss sieht man dann noch einmal
  67. alle Punkte aufgelistet und welchem Klaster die Punkte zugeordnet wurden. Aber wie gesagt, eigentlich kam raus bei der Lbogenmethode, dass wir am besten
  68. zwei Klaster wählen. Also wählen wir die Anzahl der Klaster mit zwei aus. Und wenn man sich nun Streudiagramm anschaut, kann man auch ganz schön hier
  69. oben ein Klaster und hier unten das zweite Klaster sehen und hier wieder die Aufteilung der einzelnen Punkte zu den Klasern.
  70. So, ich hoffe das Video hat dir gefallen. Wenn es dir gefallen hat, würde ich mich über ein Like freuen und wir sehen uns bestimmt bald wieder. Co?