Zum Inhalt springen
L

Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).

K-Means-Clusteranalyse. Algorithmus einfach erklärt

Data11:29 729 Aufrufe veröffentlicht Auf YouTube

Das Wichtigste aus dem Video

Tipp auf eine Zeit – das Video springt genau dorthin.

Transkriptautomatisch erstellt · 82 Zeilen
Herunterladen
  1. [Musik] hallo und herzlich willkommen zum heutigen Video in diesem möchte ich mal wieder eine kleine Präsentation
  2. vorstellen und zwar möchte ich mit euch eine Kamins cluster-analyse durchführen das ist ein Algorithmus der ja so im Bereich machine learning angewendet wird
  3. um einfach Daten in Gruppen zu unterteilen das gehört zum Teil an super meist learning also man hat im Prinzip einfach nur so eine Datenwolke und lässt
  4. einen Algorithmus Durchlaufen der dann diese der dann entsprechend musste in dieser Datenwolke versucht zu finden und dann entsprechend Datenpunkte zu
  5. kopieren genau das ist im Prinzip schon alles was der Algorithmus macht und ich werde so ein bisschen versuchen den Algorithmus eben auf grafischer Art und
  6. Weise zu erklären und dann zu zeigen was man auch bei diesem Algorithmus beachten muss und wie man ja sozusagen auch die beste Anzahl an Clustern bestimmen kann
  7. und in einem weiteren Video werden wir das ganze dann auch noch in pyten kodieren so natürlich habe ich auch wieder eine Grafik mitgebracht anhand
  8. habe ich jetzt zeigen wie dieser Kamins Algorithmus funktioniert und zwar sehen wir hier jetzt einmal auf der Y und x-Koordinate ja 66 Datenpunkte
  9. aufgeteilt und ich hatte ja gesagt so ein ja dass das mit dem mit dem Cluster dem Caymans Klasse Verfahren würde man jetzt ein Algorithmus Anwenden der
  10. versucht aus diesen Verteilungen aus diesen datenverteilungen jetzt Muster zu finden und zwar mit dem bloßen Auge wäre das jetzt natürlich einfach zu sehen
  11. also man könnte sagen hier ist ein Clustern aber die Daten Punkte sind hier relativ nah beieinander man würde also sagen dass sie es möglicherweise
  12. entlaster das hier ist möglicherweise ein Cluster und das ist möglicherweise Cluster so ein Kaninchen Algorithmus hat natürlich keine Augen und der sieht das
  13. nicht auf Anhieb sondern der hat einen bestimmtes Verfahren im bestimmten Ablauf mit dem er sozusagen dann versucht aus diesem Muster was für
  14. diesen Algorithmus erstmal überhaupt nicht klar ist sozusagen ein Muster zu erkennen also er versucht auf seine Art
  15. und Weise dann sofort zu gehen dass er zu dem gleichen Ergebnis wie dir kommt und dann entsprechend hier ein Cluster ähm
  16. entdeckt hier entlaster und hier ne wie das funktioniert das zeige ich euch jetzt sowas so einen Kamins Klasse Algorithmus
  17. jetzt macht ist dass er so genannte clusterzentrumide das habe ich hier versucht mit diesen Xen zu symbolisieren mit diesen bunten irgendwo auf dieses
  18. Datenfeld hier legt ne weil so ein Algorithmus der weiß jetzt nicht wie so ein Cluster aussieht er muss sich also sukzessive rantasten um dann
  19. entsprechend die Cluster bilden zu können wir wollen drei Cluster bilden man könnte auch sagen vielleicht ist das ja auch noch mal ein Cluster
  20. das spielt es an der Stelle keine Rolle bei Python später kann man da ein bisschen herum experimentieren wir sagen wir wollen drei Cluster entsprechend
  21. brauchen wir auch drei zentroide die werden hier wie gesagt zufällig jetzt verteilt und jeder jedes zentroid repräsentiert letztendlich dann ein
  22. Cluster so wie geht jetzt der Algorithmus weiter vor jetzt wird von allen Punkten zu jedem zentruite die euklidische sogenannte
  23. euklidische Distanz berechnet was das jetzt genau ist wie man das berechnet das ist jetzt nicht Teil des Videos ihr könnt euch auf jeden Fall merken
  24. ich versuche das mal einzuzeichnen dort wo der Abstand dass die jeweiligen Punktes zum centroid am geringsten ist nicht schön aber ihr wisst was ich meine
  25. also in diesem Fall hier ist der Abstand die am geringsten das heißt dieser Punkt hier der Würde zu diesem centroid gehören beziehungsweise er würde Teil
  26. dieses Clusters werden der jetzt erst im ersten Schritt gebildet wird so ich zeige euch mal wie das dann aussehen würde ähm ihr seht also diese ganzen
  27. Punkte die hätten jetzt die sind jetzt gelb warum weil die Abstände zu diesen zentruit hier kleine sind als zu diesen zentriert ich habe das jetzt wie gesagt
  28. selbst alles erstellt das ist wahrscheinlich jetzt nicht ganz 100% akkurat aber ich glaube die Logik ist nachvollziehbar nämlich jetzt mal an
  29. hier bei diesem rotes Umfeld zu erkennen ja wahrscheinlich ist das hier näher dran und das ist näher am gelben ne auf jeden Fall seht ihr Okay diese Punkte
  30. wären jetzt sozusagen ein Cluster diese Punkte bilden entlaste diese Punkte Bild entlaster ist das jetzt aber schon das optimale Ergebnis naja wahrscheinlich
  31. nicht ich glaube die Punkte hier passen eher zu dem roten hier könnte man sagen dass diese Punkte er zu diesem gelben Cluster passen und hier sozusagen ein
  32. grünes das heißt der Algorithmus ist wahrscheinlich jetzt noch nicht fertig das heißt was macht er das erste was er tut ist das jetzt diese
  33. zentroide zu ihrem neuen Mittelpunkt hin verschoben werden ich habe euch das mal versuchen zu fallen aufzuzeichnen also das neue Zentrum der zentruide der wird
  34. jetzt für jedes Cluster neu berechnet das heißt daher kommt auch der Name Kay means Klasse Ring das heißt die
  35. durchschnittlichen Abweichung ne ähm der Punkte zu diesem zentruiert hier der aller gelben Punkte zu diesem Android der ist hier am
  36. geringsten und deshalb kommt der zentriert an dieser Stelle wenn dann das jetzt mit breit macht würde wahrscheinlich ein bisschen
  37. woanders sein ich habe das wie gesagt alles mit meinem bloßen Auge versucht halbwegs äh nachvollziehbar nachzuzeichnen aber das ist sozusagen
  38. der neue Mittelpunkt für die Abstände zu diesen zentruit hier alle gelben Punkte am geringsten ist der durchschnittlich Abstand und bei Grün wäre das dann hier
  39. und dann ungefähr hier das heißt ihr seht wenn ich die Falle jetzt weg mache hat sich jetzt hier entsprechend aufgrund des neuen der neuen Position
  40. des zentruits ein neues Cluster gebildet die Punkte sind jetzt rot die waren vorher gelb die Punkte sind okay hier sind auch noch ein paar grüne jetzt
  41. wieder gelb geworden und so weiter so jetzt ist natürlich das Verfahren euch abgeschlossen wir haben neuen Mittelpunkt das heißt dezentrale werden
  42. wieder zu ihrem zu ihrem neuen Mitte hin verschoben ich mache die Pfeile mal weg das heißt hier hat sich ein neues Glas gebildet hier hat sich neues Cluster
  43. gewählt und hier so jetzt gehen wir mal weiter es wird wieder verschoben okay ich glaube wir können sagen jetzt ist das Cluster es ist der Algorithmus
  44. sozusagen an sein Ende angelangt und er käme jetzt zum Resultat dass er sagt okay das hier ist ein Cluster das hier ist ein Cluster das hier ist ein Cluster
  45. wenn wir wie gesagt als Vorgabe sagen du hast drei Klasse zur Verfügung Bilde daraus bitte 3 klasse so an der Stelle ist es natürlich noch
  46. wichtig bevor wir weitergehen zur sogenannten ellbo-methode das wäre dann auch der letzte Punkt was das Kreuz erkläre ich dann gleich ist noch zu
  47. betonen dass das Endresultat ein das Gamings clusterings Verfahren natürlich auch ein Stück weit davon abhängt welche clusterzentrumide ich wo verwendet also
  48. je nachdem wo ich die clusterzentrum positioniere ergibt sich dann entsprechend auch ein anderes Bild und möglicherweise auch ungenaues ne und das
  49. eben zu beheben wird das camance-verfahren einfach mehrere Male mit verschiedenen Startpunkten der zentruide durchgeführt und da ist es vor
  50. allem dann wichtig das hatte ich ja vorhin schon gesagt zu verstehen dass die Cluster mit der kleinsten Summe der quadrierten Abstände zwischen
  51. clusterzentrum und den jeweiligen Punkten genommen wird ne also wenn das Ergebnis dann letztendlich Algorithmus sozusagen fertig ist dann sind die
  52. Cluster aus dieser Berechnung heraus entstanden also die Punkte die dann zu diesem Cluster gehören die bilden wirklich dann den geringsten
  53. Abstand aber das was ich mit der euklidischen Distanz gesagt haben und ähm dabei da kommen wir noch auf den letzten Punkt zu sprechen mit jedem
  54. zusätzlichen Cluster wird die Sonne der Abstände immer kleiner aber da kommen wir gleich noch mal drauf zurück was ist damit auf sich hat an der Stelle sei
  55. schon mal gesagt je mehr Cluster ich habe das so geringer wird dann mit jedem zusätzlichen Cluster der Informationsgehalt aber da kommen wir
  56. gleich noch mal drauf zu sprechen jetzt erstmal die sogenannte Ellbogen oder Ellenbogen und so in etwa könnte diese sogenannte
  57. l-baumethode grafisch dargestellt werden was ihr hier seht ist jetzt auf der x-Achse einmal die Anzahl der jeweiligen Cluster und auf der Y-Achse die Summe
  58. der quadrierten Abweichung was bedeutet das das heißt wenn ich jetzt ein Cluster beispielsweise verwenden würde da wäre die Summe der quadrierten Abweichung
  59. aller Punkte zu diesem Cluster am höchsten nicht zeige euch gleich was es damit auf sich hatten warum das so ist ihr könnt euch aber jetzt schon mal
  60. merken ähm wenn ich zwei Cluster nehme dann nimmt die Summe der quartierten Abweichung ab bei 3 Klasse nimmt sie noch mal ab hier ist jetzt so ähm hier
  61. ist jetzt auch noch mal so ein Knick ähm das bedeutet dass die ab dem dritten Cluster wenn ich hier von 3 auf 4 Klasse gehe die Summe der vertreten Abweichung
  62. weniger stark abnimmt als hier zwischen dem zweiten und dritten Klasse und die jeden zusätzlichen Cluster nimmt die Summe der quadrierten Abweichung immer
  63. etwas weniger ab wir kriegen also immer weniger Informationsgehalt aber warum ist das jetzt so dass hier die Summe der quadrierten Abweichung bei endlaste so
  64. hoch ist und bei dreiklassen deutlich weniger das kann ich euch anhand dieses Beispiels erklären nehmen wir mal an wir haben jetzt das ist wie gesagt noch mal
  65. der das Datenfeld was sie für uns schon hatten wir nehmen jetzt eine Clusterlösung also hier ist jetzt unser Cluster so und dann würde jetzt die
  66. Summe der quadrierten Abweichung von jedem einzelnen Punkt berechnet werden ne also ihr seht und wenn man da ganz hintergehen dann wird das ziemlich groß
  67. ne wenn man da jetzt die ganze Summe aus den Abweichungen wird das eine riesige Summe wenn wir jetzt zehn Blaster nehmen ne dann kann man sich vorstellen dass
  68. die Summe der quadrierten Abweichung deutlich kleiner wird ne weil einfach diese höhere Anzahl an Clustern die Abstände
  69. zwangsläufig minimiert wenn wir das hier vergleichen hat man sehr oft sehr große Abstände und hier hat man einfach sehr oft sehr kleine Abstände und das ist
  70. eben der Grund warum mit jedem zusätzlichen Cluster die Summe der quadrierten Abweichung abnimmt da könnt ihr euch vorstellen
  71. wenn wir dann ich gehe noch mal zurück wenn wir dann jeden einzelnen Punkt als Cluster bezeichnen hat man ja logischerweise Abstände von Null aber
  72. was bringt mir das dann habe ich halt jeden einzelnen Punkt als Cluster bezeichnen und habe überhaupt gar keine Informationsgehalt ich weiß ja nur der
  73. Punkt ist irgendwie anders als der aber warum keine Ahnung wichtig ist ja dass wir gucken ob wir ähnliche Punkte mit ähnlichen Eigenschaften ein Cluster
  74. bilden und das ist genau das was wir wissen wollen und deshalb wäre in diesem Fall eine 3 Klasse Lösung am besten warum weil hier der sogenannte Knick ist
  75. da kommt auch der Name Ellbogen Methode wenn ihr euren Arm so ein bisschen anwinkelt dann ist das genau an der Stelle wo der Knick ist dort nimm alle
  76. Informationsgehalt mit jedem zusätzlichen Cluster ab also hier aufgrund der ellbohrmethode und dass das was ich vorhin gesagt habe mit der
  77. könnte man dann entscheiden was für eine Anzahl an Cluster wie für das oder entlasten wir für das jeweilige Modell verwenden möchten und an dieser Stelle
  78. soll es das dann auch gewesen sein ich werde das ganze noch mal in Python kodieren natürlich dann auch mit einem anderen Datensatz mit einem zufällig
  79. erzeugten Datensatz und werde euch zeigen wie man das dort macht da kommt jetzt auch noch ein Video in den nächsten Wochen Tagen raus weiß ich
  80. jetzt noch nicht ähm genau und dann sollte das auch noch mal klar werden wie das Ganze in Pfeifen gemacht wird weil dort muss man es ja letztendlich auch
  81. können ja ich hoffe das Video hat euch gefallen hat euch ein bisschen weiter geholfen ich würde mich freuen wenn ihr ein Abo da lässt und vielleicht ein
  82. Daumen nach oben macht und dann sehen wir uns beim nächsten Mal wieder bis dahin tschüss

Zum Nachlesen