Der K-Means Algorithmus - Einfache und intuitive Erklärung (Deutsch/German) Hannes Hinrichs https://www.youtube.com/watch?v=Gn6fPYD1oIU Transkript (automatisch erstellt) 0:00 hallo und herzlich willkommen zu einem video über den canes clustering algorithmus in diesem video erkläre ich euch wie genau der algorithmus 0:09 funktioniert so dass hier ein gefühl für die funktionsweise bekommt stellt euch vor ihr seid fischer und ihr sitzt an einem see und angel täglich 100 fische 0:19 aber ihr habt keine ahnung um was für fische es sich eigentlich handelt das einzige was ihr wisst ist dass es zwei verschiedene arten von fischen in 0:28 diesem see gibt seines zum beispiel thunfisch und lachs ihr habt jedoch kein wissen darüber wie man diese unterscheidet ihr schaut euch 0:37 also die eigenschaften der fische an und sucht nach einem muster anhand dessen ihr begründete vermutungen machen könnt wie ihr die beiden sorten 0:46 auseinanderhalten nehmen wir an wir beobachten zwei eigenschaften gewicht und farbe für jeden fisch schreiben wir die daten auf und visualisieren diese in 0:56 einem diagramm wie hier bei zwei eigenschaften der fische bedeutet das dass es ein zweidimensionales diagramm ist wie können wir jetzt zwischen diesen 1:07 beiden arten unterscheiden im wort kamins steckt das wort - was mittelwert bedeutet wir müssen also mittelwerte berechnen was für karl 1:18 gleich eins eine einfache rechnung wäre dann nimmt man einfach für jede dimension die werte und addiert diese für jeden daten punkt und dann teilt man 1:28 diese summe durch die gesamtzahl der datenpunkte schon habt ihr den mittelwert der daten punkte aber in unserem fall ist klar ja gleich zwei das 1:39 bedeutet dass wir zwei mittelwerte suchen das macht die berechnung etwas komplizierter und wir müssen die aufgabe 1:46 iterativ lösen dazu bestimmen wir als erstes zwei zufällige werte welche höchstwahrscheinlich noch nicht annähernd den mittelwert entsprechen 1:57 aber trotzdem behandeln wir diese als solche wie kann man nun mittelwerte benutzen um zwischen zwei fischsorten zu 2:06 unterscheiden wir müssen einfach die abstände von jedem mittelwert punkt zu jedem daten dann entscheiden wir für jeden daten 2:15 punkt welcher mittelwert der nächste ist in diesem beispiel nehmen wir den unteren wir färben diesen daten punkt mal rot im nächsten beispiel haben wir 2:24 einen daten punkt welcher dem oberen mittelfeld punkt am nächsten ist nehmen wir die farbe grün für diesen daten punkt wir wiederholen diese 2:34 prozedur für jeden einzelnen daten punkt dann sieht das am ende so aus wie ihr vielleicht bemerkt habt wenn man für jeden beliebigen punkt im raum die 2:44 kritische distanz zum nächsten mittelwert punkten misst und diesen zuweist erhalten wir eine lineare trennung in anderen worten gibt es eine 2:54 gerade linie welche die daten trend diese linie nennen wir jetzt mal decision boundary das problem ist nun aber dass diese linie zufällig dort 3:05 liegt da wir ja die mittelwerte zufällig ausgewählt haben deswegen müssen wir die mittelwerte jetzt anpassen 3:13 wir schauen jetzt einzeln auf jedes fragment der daten wir fangen mit der roten hälfte mal an und blendet alles andere aus für diesen 3:23 teil berechnen wir dann den mittelpunkt und in dieser hälfte haben wir nur einen mittelpunkt und wir wissen ja wie man einen mittelpunkt berechnet zur 3:33 erinnerung für jede dimension addieren wir die werte der daten punkte und teilen diese summe durch die anzahl der daten punkte das kommt dabei heraus 3:43 gehen wir jetzt noch mal einen schritt zurück und gucken zudem auf den grünen teil der daten an auch hierfür berechnen wir einen neuen 3:52 mittelwert in dem wir nur die grünen daten mit einbeziehen für beide mittelwerte sieht die veränderung also so aus 4:02 im prinzip haben wir schon alle schritte die wir brauchen um die richtigen um die richtige decision brown rief für die trennung der beiden klassen zu bestimmen 4:12 wir müssen jetzt nur alles wiederholen was wir wissen als wir das erste mal unsere stadt werte für die mittelwerte hatten haben wir ja 4:20 die abstände von diesen daten punkt von diesem mittelpunkt zu jedem daten punkt gemessen diese haben wir dann dem jeweils 4:30 nächsten mittelwert zugewiesen wenn wir dies noch mal machen dann verändert sich unsere linie im vergleich zu vorher und somit werden unsere daten anders 4:40 getrennt das wiederum bedeutet dass für jeden teil der daten die mittelpunkte nicht richtig liegen und für diese erneut berechnen müssen 4:49 das sieht dann so aus und jetzt wieder holen wir das ganze wieder und wieder wir berechnen jeden abstand weise in jedem daten punkt einen cluster zu und 5:02 dann erhalten wir eine neue trennungslinie wenn wir das ganz oft wiederholen erreichen wie irgendwann einen punkt wo sich nichts mehr tut 5:10 wir haben also eine konvergenz dies ist nun die beste trennungslinie die der algorithmus finden kann so wie es aussieht werden wir diese 5:19 linie auch in dieser region vermuten wenn ihr schon andere videos auf diesem kanal über den em algorithmus gesehen 5:29 habt habt ihr bestimmt erkannt dass dieses genau eine anwendung davon ist wenn wir unsere trennungslinie bestimmen ist dies genau der east app wenn wir 5:40 unsere parameter aktualisieren hier die mittelwerte haben wir unseren emstek wir wiederholen diesen prozess bis zur konvergenz einige bemerkungen am ende 5:52 der caymans algorithmus ist ein starkes werkzeug welches für viele anwendungen machine learning verwendet wird gerade wenn ihr mehr als zwei eigenschaften 6:02 also dimensionen habt zum beispiel 10 dann ist es nicht mehr so einfach mit bloßem auge die mittelwerte zu erraten dass eben erklärt prinzip funktioniert 6:12 für mehr als zwei klassen genau gleich natürlich hat dieser algorithmus auch seine nachteile und schwächen diese werde ich in einem anderen video 6:21 erklären und außerdem werde ich noch über die mathematik hinter dem algorithmus sprechen und verschiedene anwendungs weisen 6:31 und wie man diesen algorithmus implementieren und verbessern könnte vielen dank so weit fürs zuschauen und bis zum nächsten mal