Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
K-Means-Clusteranalyse. Algorithmus einfach erklärt
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 82 Zeilen
- [Musik] hallo und herzlich willkommen zum heutigen Video in diesem möchte ich mal wieder eine kleine Präsentation
- vorstellen und zwar möchte ich mit euch eine Kamins cluster-analyse durchführen das ist ein Algorithmus der ja so im Bereich machine learning angewendet wird
- um einfach Daten in Gruppen zu unterteilen das gehört zum Teil an super meist learning also man hat im Prinzip einfach nur so eine Datenwolke und lässt
- einen Algorithmus Durchlaufen der dann diese der dann entsprechend musste in dieser Datenwolke versucht zu finden und dann entsprechend Datenpunkte zu
- kopieren genau das ist im Prinzip schon alles was der Algorithmus macht und ich werde so ein bisschen versuchen den Algorithmus eben auf grafischer Art und
- Weise zu erklären und dann zu zeigen was man auch bei diesem Algorithmus beachten muss und wie man ja sozusagen auch die beste Anzahl an Clustern bestimmen kann
- und in einem weiteren Video werden wir das ganze dann auch noch in pyten kodieren so natürlich habe ich auch wieder eine Grafik mitgebracht anhand
- habe ich jetzt zeigen wie dieser Kamins Algorithmus funktioniert und zwar sehen wir hier jetzt einmal auf der Y und x-Koordinate ja 66 Datenpunkte
- aufgeteilt und ich hatte ja gesagt so ein ja dass das mit dem mit dem Cluster dem Caymans Klasse Verfahren würde man jetzt ein Algorithmus Anwenden der
- versucht aus diesen Verteilungen aus diesen datenverteilungen jetzt Muster zu finden und zwar mit dem bloßen Auge wäre das jetzt natürlich einfach zu sehen
- also man könnte sagen hier ist ein Clustern aber die Daten Punkte sind hier relativ nah beieinander man würde also sagen dass sie es möglicherweise
- entlaster das hier ist möglicherweise ein Cluster und das ist möglicherweise Cluster so ein Kaninchen Algorithmus hat natürlich keine Augen und der sieht das
- nicht auf Anhieb sondern der hat einen bestimmtes Verfahren im bestimmten Ablauf mit dem er sozusagen dann versucht aus diesem Muster was für
- diesen Algorithmus erstmal überhaupt nicht klar ist sozusagen ein Muster zu erkennen also er versucht auf seine Art
- und Weise dann sofort zu gehen dass er zu dem gleichen Ergebnis wie dir kommt und dann entsprechend hier ein Cluster ähm
- entdeckt hier entlaster und hier ne wie das funktioniert das zeige ich euch jetzt sowas so einen Kamins Klasse Algorithmus
- jetzt macht ist dass er so genannte clusterzentrumide das habe ich hier versucht mit diesen Xen zu symbolisieren mit diesen bunten irgendwo auf dieses
- Datenfeld hier legt ne weil so ein Algorithmus der weiß jetzt nicht wie so ein Cluster aussieht er muss sich also sukzessive rantasten um dann
- entsprechend die Cluster bilden zu können wir wollen drei Cluster bilden man könnte auch sagen vielleicht ist das ja auch noch mal ein Cluster
- das spielt es an der Stelle keine Rolle bei Python später kann man da ein bisschen herum experimentieren wir sagen wir wollen drei Cluster entsprechend
- brauchen wir auch drei zentroide die werden hier wie gesagt zufällig jetzt verteilt und jeder jedes zentroid repräsentiert letztendlich dann ein
- Cluster so wie geht jetzt der Algorithmus weiter vor jetzt wird von allen Punkten zu jedem zentruite die euklidische sogenannte
- euklidische Distanz berechnet was das jetzt genau ist wie man das berechnet das ist jetzt nicht Teil des Videos ihr könnt euch auf jeden Fall merken
- ich versuche das mal einzuzeichnen dort wo der Abstand dass die jeweiligen Punktes zum centroid am geringsten ist nicht schön aber ihr wisst was ich meine
- also in diesem Fall hier ist der Abstand die am geringsten das heißt dieser Punkt hier der Würde zu diesem centroid gehören beziehungsweise er würde Teil
- dieses Clusters werden der jetzt erst im ersten Schritt gebildet wird so ich zeige euch mal wie das dann aussehen würde ähm ihr seht also diese ganzen
- Punkte die hätten jetzt die sind jetzt gelb warum weil die Abstände zu diesen zentruit hier kleine sind als zu diesen zentriert ich habe das jetzt wie gesagt
- selbst alles erstellt das ist wahrscheinlich jetzt nicht ganz 100% akkurat aber ich glaube die Logik ist nachvollziehbar nämlich jetzt mal an
- hier bei diesem rotes Umfeld zu erkennen ja wahrscheinlich ist das hier näher dran und das ist näher am gelben ne auf jeden Fall seht ihr Okay diese Punkte
- wären jetzt sozusagen ein Cluster diese Punkte bilden entlaste diese Punkte Bild entlaster ist das jetzt aber schon das optimale Ergebnis naja wahrscheinlich
- nicht ich glaube die Punkte hier passen eher zu dem roten hier könnte man sagen dass diese Punkte er zu diesem gelben Cluster passen und hier sozusagen ein
- grünes das heißt der Algorithmus ist wahrscheinlich jetzt noch nicht fertig das heißt was macht er das erste was er tut ist das jetzt diese
- zentroide zu ihrem neuen Mittelpunkt hin verschoben werden ich habe euch das mal versuchen zu fallen aufzuzeichnen also das neue Zentrum der zentruide der wird
- jetzt für jedes Cluster neu berechnet das heißt daher kommt auch der Name Kay means Klasse Ring das heißt die
- durchschnittlichen Abweichung ne ähm der Punkte zu diesem zentruiert hier der aller gelben Punkte zu diesem Android der ist hier am
- geringsten und deshalb kommt der zentriert an dieser Stelle wenn dann das jetzt mit breit macht würde wahrscheinlich ein bisschen
- woanders sein ich habe das wie gesagt alles mit meinem bloßen Auge versucht halbwegs äh nachvollziehbar nachzuzeichnen aber das ist sozusagen
- der neue Mittelpunkt für die Abstände zu diesen zentruit hier alle gelben Punkte am geringsten ist der durchschnittlich Abstand und bei Grün wäre das dann hier
- und dann ungefähr hier das heißt ihr seht wenn ich die Falle jetzt weg mache hat sich jetzt hier entsprechend aufgrund des neuen der neuen Position
- des zentruits ein neues Cluster gebildet die Punkte sind jetzt rot die waren vorher gelb die Punkte sind okay hier sind auch noch ein paar grüne jetzt
- wieder gelb geworden und so weiter so jetzt ist natürlich das Verfahren euch abgeschlossen wir haben neuen Mittelpunkt das heißt dezentrale werden
- wieder zu ihrem zu ihrem neuen Mitte hin verschoben ich mache die Pfeile mal weg das heißt hier hat sich ein neues Glas gebildet hier hat sich neues Cluster
- gewählt und hier so jetzt gehen wir mal weiter es wird wieder verschoben okay ich glaube wir können sagen jetzt ist das Cluster es ist der Algorithmus
- sozusagen an sein Ende angelangt und er käme jetzt zum Resultat dass er sagt okay das hier ist ein Cluster das hier ist ein Cluster das hier ist ein Cluster
- wenn wir wie gesagt als Vorgabe sagen du hast drei Klasse zur Verfügung Bilde daraus bitte 3 klasse so an der Stelle ist es natürlich noch
- wichtig bevor wir weitergehen zur sogenannten ellbo-methode das wäre dann auch der letzte Punkt was das Kreuz erkläre ich dann gleich ist noch zu
- betonen dass das Endresultat ein das Gamings clusterings Verfahren natürlich auch ein Stück weit davon abhängt welche clusterzentrumide ich wo verwendet also
- je nachdem wo ich die clusterzentrum positioniere ergibt sich dann entsprechend auch ein anderes Bild und möglicherweise auch ungenaues ne und das
- eben zu beheben wird das camance-verfahren einfach mehrere Male mit verschiedenen Startpunkten der zentruide durchgeführt und da ist es vor
- allem dann wichtig das hatte ich ja vorhin schon gesagt zu verstehen dass die Cluster mit der kleinsten Summe der quadrierten Abstände zwischen
- clusterzentrum und den jeweiligen Punkten genommen wird ne also wenn das Ergebnis dann letztendlich Algorithmus sozusagen fertig ist dann sind die
- Cluster aus dieser Berechnung heraus entstanden also die Punkte die dann zu diesem Cluster gehören die bilden wirklich dann den geringsten
- Abstand aber das was ich mit der euklidischen Distanz gesagt haben und ähm dabei da kommen wir noch auf den letzten Punkt zu sprechen mit jedem
- zusätzlichen Cluster wird die Sonne der Abstände immer kleiner aber da kommen wir gleich noch mal drauf zurück was ist damit auf sich hat an der Stelle sei
- schon mal gesagt je mehr Cluster ich habe das so geringer wird dann mit jedem zusätzlichen Cluster der Informationsgehalt aber da kommen wir
- gleich noch mal drauf zu sprechen jetzt erstmal die sogenannte Ellbogen oder Ellenbogen und so in etwa könnte diese sogenannte
- l-baumethode grafisch dargestellt werden was ihr hier seht ist jetzt auf der x-Achse einmal die Anzahl der jeweiligen Cluster und auf der Y-Achse die Summe
- der quadrierten Abweichung was bedeutet das das heißt wenn ich jetzt ein Cluster beispielsweise verwenden würde da wäre die Summe der quadrierten Abweichung
- aller Punkte zu diesem Cluster am höchsten nicht zeige euch gleich was es damit auf sich hatten warum das so ist ihr könnt euch aber jetzt schon mal
- merken ähm wenn ich zwei Cluster nehme dann nimmt die Summe der quartierten Abweichung ab bei 3 Klasse nimmt sie noch mal ab hier ist jetzt so ähm hier
- ist jetzt auch noch mal so ein Knick ähm das bedeutet dass die ab dem dritten Cluster wenn ich hier von 3 auf 4 Klasse gehe die Summe der vertreten Abweichung
- weniger stark abnimmt als hier zwischen dem zweiten und dritten Klasse und die jeden zusätzlichen Cluster nimmt die Summe der quadrierten Abweichung immer
- etwas weniger ab wir kriegen also immer weniger Informationsgehalt aber warum ist das jetzt so dass hier die Summe der quadrierten Abweichung bei endlaste so
- hoch ist und bei dreiklassen deutlich weniger das kann ich euch anhand dieses Beispiels erklären nehmen wir mal an wir haben jetzt das ist wie gesagt noch mal
- der das Datenfeld was sie für uns schon hatten wir nehmen jetzt eine Clusterlösung also hier ist jetzt unser Cluster so und dann würde jetzt die
- Summe der quadrierten Abweichung von jedem einzelnen Punkt berechnet werden ne also ihr seht und wenn man da ganz hintergehen dann wird das ziemlich groß
- ne wenn man da jetzt die ganze Summe aus den Abweichungen wird das eine riesige Summe wenn wir jetzt zehn Blaster nehmen ne dann kann man sich vorstellen dass
- die Summe der quadrierten Abweichung deutlich kleiner wird ne weil einfach diese höhere Anzahl an Clustern die Abstände
- zwangsläufig minimiert wenn wir das hier vergleichen hat man sehr oft sehr große Abstände und hier hat man einfach sehr oft sehr kleine Abstände und das ist
- eben der Grund warum mit jedem zusätzlichen Cluster die Summe der quadrierten Abweichung abnimmt da könnt ihr euch vorstellen
- wenn wir dann ich gehe noch mal zurück wenn wir dann jeden einzelnen Punkt als Cluster bezeichnen hat man ja logischerweise Abstände von Null aber
- was bringt mir das dann habe ich halt jeden einzelnen Punkt als Cluster bezeichnen und habe überhaupt gar keine Informationsgehalt ich weiß ja nur der
- Punkt ist irgendwie anders als der aber warum keine Ahnung wichtig ist ja dass wir gucken ob wir ähnliche Punkte mit ähnlichen Eigenschaften ein Cluster
- bilden und das ist genau das was wir wissen wollen und deshalb wäre in diesem Fall eine 3 Klasse Lösung am besten warum weil hier der sogenannte Knick ist
- da kommt auch der Name Ellbogen Methode wenn ihr euren Arm so ein bisschen anwinkelt dann ist das genau an der Stelle wo der Knick ist dort nimm alle
- Informationsgehalt mit jedem zusätzlichen Cluster ab also hier aufgrund der ellbohrmethode und dass das was ich vorhin gesagt habe mit der
- könnte man dann entscheiden was für eine Anzahl an Cluster wie für das oder entlasten wir für das jeweilige Modell verwenden möchten und an dieser Stelle
- soll es das dann auch gewesen sein ich werde das ganze noch mal in Python kodieren natürlich dann auch mit einem anderen Datensatz mit einem zufällig
- erzeugten Datensatz und werde euch zeigen wie man das dort macht da kommt jetzt auch noch ein Video in den nächsten Wochen Tagen raus weiß ich
- jetzt noch nicht ähm genau und dann sollte das auch noch mal klar werden wie das Ganze in Pfeifen gemacht wird weil dort muss man es ja letztendlich auch
- können ja ich hoffe das Video hat euch gefallen hat euch ein bisschen weiter geholfen ich würde mich freuen wenn ihr ein Abo da lässt und vielleicht ein
- Daumen nach oben macht und dann sehen wir uns beim nächsten Mal wieder bis dahin tschüss
Zum Nachlesen
K-Means-AlgorithmusEin k-Means-Algorithmus ist ein Verfahren zur Vektorquantisierung, das auch zur Clusteranalyse verwendet wird. Dabei wird aus einer Menge von ähnlichen …
ClusteranalyseUnter Clusteranalyse (Clustering-Algorithmus, gelegentlich auch: Ballungsanalyse) versteht man ein Verfahren zur Entdeckung von Ähnlichkeitsstrukturen in …
Cluster (Datenanalyse)Als Cluster (gelegentlich auch Ballungen) bezeichnet man in der Informatik und Statistik eine Gruppe von Datenobjekten mit ähnlichen Eigenschaften.
Fuzzy-c-Means-AlgorithmusIn der Informatik ist der Fuzzy-c-Means-Algorithmus, auch Algorithmus der c unscharfen Mittelwerte, ein unüberwachter Clustering-Algorithmus, der eine …