K-Means-Clusteranalyse. Algorithmus einfach erklärt Data https://www.youtube.com/watch?v=vdyChdOtUBY Transkript (automatisch erstellt) 0:06 [Musik] hallo und herzlich willkommen zum heutigen Video in diesem möchte ich mal wieder eine kleine Präsentation 0:15 vorstellen und zwar möchte ich mit euch eine Kamins cluster-analyse durchführen das ist ein Algorithmus der ja so im Bereich machine learning angewendet wird 0:26 um einfach Daten in Gruppen zu unterteilen das gehört zum Teil an super meist learning also man hat im Prinzip einfach nur so eine Datenwolke und lässt 0:35 einen Algorithmus Durchlaufen der dann diese der dann entsprechend musste in dieser Datenwolke versucht zu finden und dann entsprechend Datenpunkte zu 0:43 kopieren genau das ist im Prinzip schon alles was der Algorithmus macht und ich werde so ein bisschen versuchen den Algorithmus eben auf grafischer Art und 0:51 Weise zu erklären und dann zu zeigen was man auch bei diesem Algorithmus beachten muss und wie man ja sozusagen auch die beste Anzahl an Clustern bestimmen kann 1:01 und in einem weiteren Video werden wir das ganze dann auch noch in pyten kodieren so natürlich habe ich auch wieder eine Grafik mitgebracht anhand 1:11 habe ich jetzt zeigen wie dieser Kamins Algorithmus funktioniert und zwar sehen wir hier jetzt einmal auf der Y und x-Koordinate ja 66 Datenpunkte 1:20 aufgeteilt und ich hatte ja gesagt so ein ja dass das mit dem mit dem Cluster dem Caymans Klasse Verfahren würde man jetzt ein Algorithmus Anwenden der 1:30 versucht aus diesen Verteilungen aus diesen datenverteilungen jetzt Muster zu finden und zwar mit dem bloßen Auge wäre das jetzt natürlich einfach zu sehen 1:39 also man könnte sagen hier ist ein Clustern aber die Daten Punkte sind hier relativ nah beieinander man würde also sagen dass sie es möglicherweise 1:46 entlaster das hier ist möglicherweise ein Cluster und das ist möglicherweise Cluster so ein Kaninchen Algorithmus hat natürlich keine Augen und der sieht das 1:54 nicht auf Anhieb sondern der hat einen bestimmtes Verfahren im bestimmten Ablauf mit dem er sozusagen dann versucht aus diesem Muster was für 2:02 diesen Algorithmus erstmal überhaupt nicht klar ist sozusagen ein Muster zu erkennen also er versucht auf seine Art 2:09 und Weise dann sofort zu gehen dass er zu dem gleichen Ergebnis wie dir kommt und dann entsprechend hier ein Cluster ähm 2:15 entdeckt hier entlaster und hier ne wie das funktioniert das zeige ich euch jetzt sowas so einen Kamins Klasse Algorithmus 2:22 jetzt macht ist dass er so genannte clusterzentrumide das habe ich hier versucht mit diesen Xen zu symbolisieren mit diesen bunten irgendwo auf dieses 2:30 Datenfeld hier legt ne weil so ein Algorithmus der weiß jetzt nicht wie so ein Cluster aussieht er muss sich also sukzessive rantasten um dann 2:38 entsprechend die Cluster bilden zu können wir wollen drei Cluster bilden man könnte auch sagen vielleicht ist das ja auch noch mal ein Cluster 2:45 das spielt es an der Stelle keine Rolle bei Python später kann man da ein bisschen herum experimentieren wir sagen wir wollen drei Cluster entsprechend 2:53 brauchen wir auch drei zentroide die werden hier wie gesagt zufällig jetzt verteilt und jeder jedes zentroid repräsentiert letztendlich dann ein 3:02 Cluster so wie geht jetzt der Algorithmus weiter vor jetzt wird von allen Punkten zu jedem zentruite die euklidische sogenannte 3:13 euklidische Distanz berechnet was das jetzt genau ist wie man das berechnet das ist jetzt nicht Teil des Videos ihr könnt euch auf jeden Fall merken 3:20 ich versuche das mal einzuzeichnen dort wo der Abstand dass die jeweiligen Punktes zum centroid am geringsten ist nicht schön aber ihr wisst was ich meine 3:29 also in diesem Fall hier ist der Abstand die am geringsten das heißt dieser Punkt hier der Würde zu diesem centroid gehören beziehungsweise er würde Teil 3:39 dieses Clusters werden der jetzt erst im ersten Schritt gebildet wird so ich zeige euch mal wie das dann aussehen würde ähm ihr seht also diese ganzen 3:49 Punkte die hätten jetzt die sind jetzt gelb warum weil die Abstände zu diesen zentruit hier kleine sind als zu diesen zentriert ich habe das jetzt wie gesagt 3:59 selbst alles erstellt das ist wahrscheinlich jetzt nicht ganz 100% akkurat aber ich glaube die Logik ist nachvollziehbar nämlich jetzt mal an 4:07 hier bei diesem rotes Umfeld zu erkennen ja wahrscheinlich ist das hier näher dran und das ist näher am gelben ne auf jeden Fall seht ihr Okay diese Punkte 4:15 wären jetzt sozusagen ein Cluster diese Punkte bilden entlaste diese Punkte Bild entlaster ist das jetzt aber schon das optimale Ergebnis naja wahrscheinlich 4:24 nicht ich glaube die Punkte hier passen eher zu dem roten hier könnte man sagen dass diese Punkte er zu diesem gelben Cluster passen und hier sozusagen ein 4:34 grünes das heißt der Algorithmus ist wahrscheinlich jetzt noch nicht fertig das heißt was macht er das erste was er tut ist das jetzt diese 4:42 zentroide zu ihrem neuen Mittelpunkt hin verschoben werden ich habe euch das mal versuchen zu fallen aufzuzeichnen also das neue Zentrum der zentruide der wird 4:51 jetzt für jedes Cluster neu berechnet das heißt daher kommt auch der Name Kay means Klasse Ring das heißt die 5:00 durchschnittlichen Abweichung ne ähm der Punkte zu diesem zentruiert hier der aller gelben Punkte zu diesem Android der ist hier am 5:11 geringsten und deshalb kommt der zentriert an dieser Stelle wenn dann das jetzt mit breit macht würde wahrscheinlich ein bisschen 5:19 woanders sein ich habe das wie gesagt alles mit meinem bloßen Auge versucht halbwegs äh nachvollziehbar nachzuzeichnen aber das ist sozusagen 5:25 der neue Mittelpunkt für die Abstände zu diesen zentruit hier alle gelben Punkte am geringsten ist der durchschnittlich Abstand und bei Grün wäre das dann hier 5:32 und dann ungefähr hier das heißt ihr seht wenn ich die Falle jetzt weg mache hat sich jetzt hier entsprechend aufgrund des neuen der neuen Position 5:42 des zentruits ein neues Cluster gebildet die Punkte sind jetzt rot die waren vorher gelb die Punkte sind okay hier sind auch noch ein paar grüne jetzt 5:49 wieder gelb geworden und so weiter so jetzt ist natürlich das Verfahren euch abgeschlossen wir haben neuen Mittelpunkt das heißt dezentrale werden 5:57 wieder zu ihrem zu ihrem neuen Mitte hin verschoben ich mache die Pfeile mal weg das heißt hier hat sich ein neues Glas gebildet hier hat sich neues Cluster 6:04 gewählt und hier so jetzt gehen wir mal weiter es wird wieder verschoben okay ich glaube wir können sagen jetzt ist das Cluster es ist der Algorithmus 6:12 sozusagen an sein Ende angelangt und er käme jetzt zum Resultat dass er sagt okay das hier ist ein Cluster das hier ist ein Cluster das hier ist ein Cluster 6:19 wenn wir wie gesagt als Vorgabe sagen du hast drei Klasse zur Verfügung Bilde daraus bitte 3 klasse so an der Stelle ist es natürlich noch 6:30 wichtig bevor wir weitergehen zur sogenannten ellbo-methode das wäre dann auch der letzte Punkt was das Kreuz erkläre ich dann gleich ist noch zu 6:36 betonen dass das Endresultat ein das Gamings clusterings Verfahren natürlich auch ein Stück weit davon abhängt welche clusterzentrumide ich wo verwendet also 6:45 je nachdem wo ich die clusterzentrum positioniere ergibt sich dann entsprechend auch ein anderes Bild und möglicherweise auch ungenaues ne und das 6:53 eben zu beheben wird das camance-verfahren einfach mehrere Male mit verschiedenen Startpunkten der zentruide durchgeführt und da ist es vor 7:01 allem dann wichtig das hatte ich ja vorhin schon gesagt zu verstehen dass die Cluster mit der kleinsten Summe der quadrierten Abstände zwischen 7:09 clusterzentrum und den jeweiligen Punkten genommen wird ne also wenn das Ergebnis dann letztendlich Algorithmus sozusagen fertig ist dann sind die 7:17 Cluster aus dieser Berechnung heraus entstanden also die Punkte die dann zu diesem Cluster gehören die bilden wirklich dann den geringsten 7:26 Abstand aber das was ich mit der euklidischen Distanz gesagt haben und ähm dabei da kommen wir noch auf den letzten Punkt zu sprechen mit jedem 7:36 zusätzlichen Cluster wird die Sonne der Abstände immer kleiner aber da kommen wir gleich noch mal drauf zurück was ist damit auf sich hat an der Stelle sei 7:42 schon mal gesagt je mehr Cluster ich habe das so geringer wird dann mit jedem zusätzlichen Cluster der Informationsgehalt aber da kommen wir 7:49 gleich noch mal drauf zu sprechen jetzt erstmal die sogenannte Ellbogen oder Ellenbogen und so in etwa könnte diese sogenannte 7:57 l-baumethode grafisch dargestellt werden was ihr hier seht ist jetzt auf der x-Achse einmal die Anzahl der jeweiligen Cluster und auf der Y-Achse die Summe 8:06 der quadrierten Abweichung was bedeutet das das heißt wenn ich jetzt ein Cluster beispielsweise verwenden würde da wäre die Summe der quadrierten Abweichung 8:15 aller Punkte zu diesem Cluster am höchsten nicht zeige euch gleich was es damit auf sich hatten warum das so ist ihr könnt euch aber jetzt schon mal 8:21 merken ähm wenn ich zwei Cluster nehme dann nimmt die Summe der quartierten Abweichung ab bei 3 Klasse nimmt sie noch mal ab hier ist jetzt so ähm hier 8:30 ist jetzt auch noch mal so ein Knick ähm das bedeutet dass die ab dem dritten Cluster wenn ich hier von 3 auf 4 Klasse gehe die Summe der vertreten Abweichung 8:40 weniger stark abnimmt als hier zwischen dem zweiten und dritten Klasse und die jeden zusätzlichen Cluster nimmt die Summe der quadrierten Abweichung immer 8:48 etwas weniger ab wir kriegen also immer weniger Informationsgehalt aber warum ist das jetzt so dass hier die Summe der quadrierten Abweichung bei endlaste so 8:57 hoch ist und bei dreiklassen deutlich weniger das kann ich euch anhand dieses Beispiels erklären nehmen wir mal an wir haben jetzt das ist wie gesagt noch mal 9:06 der das Datenfeld was sie für uns schon hatten wir nehmen jetzt eine Clusterlösung also hier ist jetzt unser Cluster so und dann würde jetzt die 9:13 Summe der quadrierten Abweichung von jedem einzelnen Punkt berechnet werden ne also ihr seht und wenn man da ganz hintergehen dann wird das ziemlich groß 9:23 ne wenn man da jetzt die ganze Summe aus den Abweichungen wird das eine riesige Summe wenn wir jetzt zehn Blaster nehmen ne dann kann man sich vorstellen dass 9:32 die Summe der quadrierten Abweichung deutlich kleiner wird ne weil einfach diese höhere Anzahl an Clustern die Abstände 9:41 zwangsläufig minimiert wenn wir das hier vergleichen hat man sehr oft sehr große Abstände und hier hat man einfach sehr oft sehr kleine Abstände und das ist 9:50 eben der Grund warum mit jedem zusätzlichen Cluster die Summe der quadrierten Abweichung abnimmt da könnt ihr euch vorstellen 9:57 wenn wir dann ich gehe noch mal zurück wenn wir dann jeden einzelnen Punkt als Cluster bezeichnen hat man ja logischerweise Abstände von Null aber 10:05 was bringt mir das dann habe ich halt jeden einzelnen Punkt als Cluster bezeichnen und habe überhaupt gar keine Informationsgehalt ich weiß ja nur der 10:13 Punkt ist irgendwie anders als der aber warum keine Ahnung wichtig ist ja dass wir gucken ob wir ähnliche Punkte mit ähnlichen Eigenschaften ein Cluster 10:22 bilden und das ist genau das was wir wissen wollen und deshalb wäre in diesem Fall eine 3 Klasse Lösung am besten warum weil hier der sogenannte Knick ist 10:31 da kommt auch der Name Ellbogen Methode wenn ihr euren Arm so ein bisschen anwinkelt dann ist das genau an der Stelle wo der Knick ist dort nimm alle 10:39 Informationsgehalt mit jedem zusätzlichen Cluster ab also hier aufgrund der ellbohrmethode und dass das was ich vorhin gesagt habe mit der 10:46 könnte man dann entscheiden was für eine Anzahl an Cluster wie für das oder entlasten wir für das jeweilige Modell verwenden möchten und an dieser Stelle 10:56 soll es das dann auch gewesen sein ich werde das ganze noch mal in Python kodieren natürlich dann auch mit einem anderen Datensatz mit einem zufällig 11:03 erzeugten Datensatz und werde euch zeigen wie man das dort macht da kommt jetzt auch noch ein Video in den nächsten Wochen Tagen raus weiß ich 11:10 jetzt noch nicht ähm genau und dann sollte das auch noch mal klar werden wie das Ganze in Pfeifen gemacht wird weil dort muss man es ja letztendlich auch 11:18 können ja ich hoffe das Video hat euch gefallen hat euch ein bisschen weiter geholfen ich würde mich freuen wenn ihr ein Abo da lässt und vielleicht ein 11:24 Daumen nach oben macht und dann sehen wir uns beim nächsten Mal wieder bis dahin tschüss