Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
Der K-Means Algorithmus - Einfache und intuitive Erklärung (Deutsch/German)
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 41 Zeilen
- hallo und herzlich willkommen zu einem video über den canes clustering algorithmus in diesem video erkläre ich euch wie genau der algorithmus
- funktioniert so dass hier ein gefühl für die funktionsweise bekommt stellt euch vor ihr seid fischer und ihr sitzt an einem see und angel täglich 100 fische
- aber ihr habt keine ahnung um was für fische es sich eigentlich handelt das einzige was ihr wisst ist dass es zwei verschiedene arten von fischen in
- diesem see gibt seines zum beispiel thunfisch und lachs ihr habt jedoch kein wissen darüber wie man diese unterscheidet ihr schaut euch
- also die eigenschaften der fische an und sucht nach einem muster anhand dessen ihr begründete vermutungen machen könnt wie ihr die beiden sorten
- auseinanderhalten nehmen wir an wir beobachten zwei eigenschaften gewicht und farbe für jeden fisch schreiben wir die daten auf und visualisieren diese in
- einem diagramm wie hier bei zwei eigenschaften der fische bedeutet das dass es ein zweidimensionales diagramm ist wie können wir jetzt zwischen diesen
- beiden arten unterscheiden im wort kamins steckt das wort - was mittelwert bedeutet wir müssen also mittelwerte berechnen was für karl
- gleich eins eine einfache rechnung wäre dann nimmt man einfach für jede dimension die werte und addiert diese für jeden daten punkt und dann teilt man
- diese summe durch die gesamtzahl der datenpunkte schon habt ihr den mittelwert der daten punkte aber in unserem fall ist klar ja gleich zwei das
- bedeutet dass wir zwei mittelwerte suchen das macht die berechnung etwas komplizierter und wir müssen die aufgabe
- iterativ lösen dazu bestimmen wir als erstes zwei zufällige werte welche höchstwahrscheinlich noch nicht annähernd den mittelwert entsprechen
- aber trotzdem behandeln wir diese als solche wie kann man nun mittelwerte benutzen um zwischen zwei fischsorten zu
- unterscheiden wir müssen einfach die abstände von jedem mittelwert punkt zu jedem daten dann entscheiden wir für jeden daten
- punkt welcher mittelwert der nächste ist in diesem beispiel nehmen wir den unteren wir färben diesen daten punkt mal rot im nächsten beispiel haben wir
- einen daten punkt welcher dem oberen mittelfeld punkt am nächsten ist nehmen wir die farbe grün für diesen daten punkt wir wiederholen diese
- prozedur für jeden einzelnen daten punkt dann sieht das am ende so aus wie ihr vielleicht bemerkt habt wenn man für jeden beliebigen punkt im raum die
- kritische distanz zum nächsten mittelwert punkten misst und diesen zuweist erhalten wir eine lineare trennung in anderen worten gibt es eine
- gerade linie welche die daten trend diese linie nennen wir jetzt mal decision boundary das problem ist nun aber dass diese linie zufällig dort
- liegt da wir ja die mittelwerte zufällig ausgewählt haben deswegen müssen wir die mittelwerte jetzt anpassen
- wir schauen jetzt einzeln auf jedes fragment der daten wir fangen mit der roten hälfte mal an und blendet alles andere aus für diesen
- teil berechnen wir dann den mittelpunkt und in dieser hälfte haben wir nur einen mittelpunkt und wir wissen ja wie man einen mittelpunkt berechnet zur
- erinnerung für jede dimension addieren wir die werte der daten punkte und teilen diese summe durch die anzahl der daten punkte das kommt dabei heraus
- gehen wir jetzt noch mal einen schritt zurück und gucken zudem auf den grünen teil der daten an auch hierfür berechnen wir einen neuen
- mittelwert in dem wir nur die grünen daten mit einbeziehen für beide mittelwerte sieht die veränderung also so aus
- im prinzip haben wir schon alle schritte die wir brauchen um die richtigen um die richtige decision brown rief für die trennung der beiden klassen zu bestimmen
- wir müssen jetzt nur alles wiederholen was wir wissen als wir das erste mal unsere stadt werte für die mittelwerte hatten haben wir ja
- die abstände von diesen daten punkt von diesem mittelpunkt zu jedem daten punkt gemessen diese haben wir dann dem jeweils
- nächsten mittelwert zugewiesen wenn wir dies noch mal machen dann verändert sich unsere linie im vergleich zu vorher und somit werden unsere daten anders
- getrennt das wiederum bedeutet dass für jeden teil der daten die mittelpunkte nicht richtig liegen und für diese erneut berechnen müssen
- das sieht dann so aus und jetzt wieder holen wir das ganze wieder und wieder wir berechnen jeden abstand weise in jedem daten punkt einen cluster zu und
- dann erhalten wir eine neue trennungslinie wenn wir das ganz oft wiederholen erreichen wie irgendwann einen punkt wo sich nichts mehr tut
- wir haben also eine konvergenz dies ist nun die beste trennungslinie die der algorithmus finden kann so wie es aussieht werden wir diese
- linie auch in dieser region vermuten wenn ihr schon andere videos auf diesem kanal über den em algorithmus gesehen
- habt habt ihr bestimmt erkannt dass dieses genau eine anwendung davon ist wenn wir unsere trennungslinie bestimmen ist dies genau der east app wenn wir
- unsere parameter aktualisieren hier die mittelwerte haben wir unseren emstek wir wiederholen diesen prozess bis zur konvergenz einige bemerkungen am ende
- der caymans algorithmus ist ein starkes werkzeug welches für viele anwendungen machine learning verwendet wird gerade wenn ihr mehr als zwei eigenschaften
- also dimensionen habt zum beispiel 10 dann ist es nicht mehr so einfach mit bloßem auge die mittelwerte zu erraten dass eben erklärt prinzip funktioniert
- für mehr als zwei klassen genau gleich natürlich hat dieser algorithmus auch seine nachteile und schwächen diese werde ich in einem anderen video
- erklären und außerdem werde ich noch über die mathematik hinter dem algorithmus sprechen und verschiedene anwendungs weisen
- und wie man diesen algorithmus implementieren und verbessern könnte vielen dank so weit fürs zuschauen und bis zum nächsten mal
Zum Nachlesen
K-Means-AlgorithmusEin k-Means-Algorithmus ist ein Verfahren zur Vektorquantisierung, das auch zur Clusteranalyse verwendet wird. Dabei wird aus einer Menge von ähnlichen …
ClusteranalyseUnter Clusteranalyse (Clustering-Algorithmus, gelegentlich auch: Ballungsanalyse) versteht man ein Verfahren zur Entdeckung von Ähnlichkeitsstrukturen in …
Fuzzy-c-Means-AlgorithmusIn der Informatik ist der Fuzzy-c-Means-Algorithmus, auch Algorithmus der c unscharfen Mittelwerte, ein unüberwachter Clustering-Algorithmus, der eine …
Cluster (Datenanalyse)Als Cluster (gelegentlich auch Ballungen) bezeichnet man in der Informatik und Statistik eine Gruppe von Datenobjekten mit ähnlichen Eigenschaften.