Zum Inhalt springen
L

Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).

Der K-Means Algorithmus - Einfache und intuitive Erklärung (Deutsch/German)

Hannes Hinrichs6:43 33.205 Aufrufe veröffentlicht Auf YouTube

Das Wichtigste aus dem Video

Tipp auf eine Zeit – das Video springt genau dorthin.

Transkriptautomatisch erstellt · 41 Zeilen
Herunterladen
  1. hallo und herzlich willkommen zu einem video über den canes clustering algorithmus in diesem video erkläre ich euch wie genau der algorithmus
  2. funktioniert so dass hier ein gefühl für die funktionsweise bekommt stellt euch vor ihr seid fischer und ihr sitzt an einem see und angel täglich 100 fische
  3. aber ihr habt keine ahnung um was für fische es sich eigentlich handelt das einzige was ihr wisst ist dass es zwei verschiedene arten von fischen in
  4. diesem see gibt seines zum beispiel thunfisch und lachs ihr habt jedoch kein wissen darüber wie man diese unterscheidet ihr schaut euch
  5. also die eigenschaften der fische an und sucht nach einem muster anhand dessen ihr begründete vermutungen machen könnt wie ihr die beiden sorten
  6. auseinanderhalten nehmen wir an wir beobachten zwei eigenschaften gewicht und farbe für jeden fisch schreiben wir die daten auf und visualisieren diese in
  7. einem diagramm wie hier bei zwei eigenschaften der fische bedeutet das dass es ein zweidimensionales diagramm ist wie können wir jetzt zwischen diesen
  8. beiden arten unterscheiden im wort kamins steckt das wort - was mittelwert bedeutet wir müssen also mittelwerte berechnen was für karl
  9. gleich eins eine einfache rechnung wäre dann nimmt man einfach für jede dimension die werte und addiert diese für jeden daten punkt und dann teilt man
  10. diese summe durch die gesamtzahl der datenpunkte schon habt ihr den mittelwert der daten punkte aber in unserem fall ist klar ja gleich zwei das
  11. bedeutet dass wir zwei mittelwerte suchen das macht die berechnung etwas komplizierter und wir müssen die aufgabe
  12. iterativ lösen dazu bestimmen wir als erstes zwei zufällige werte welche höchstwahrscheinlich noch nicht annähernd den mittelwert entsprechen
  13. aber trotzdem behandeln wir diese als solche wie kann man nun mittelwerte benutzen um zwischen zwei fischsorten zu
  14. unterscheiden wir müssen einfach die abstände von jedem mittelwert punkt zu jedem daten dann entscheiden wir für jeden daten
  15. punkt welcher mittelwert der nächste ist in diesem beispiel nehmen wir den unteren wir färben diesen daten punkt mal rot im nächsten beispiel haben wir
  16. einen daten punkt welcher dem oberen mittelfeld punkt am nächsten ist nehmen wir die farbe grün für diesen daten punkt wir wiederholen diese
  17. prozedur für jeden einzelnen daten punkt dann sieht das am ende so aus wie ihr vielleicht bemerkt habt wenn man für jeden beliebigen punkt im raum die
  18. kritische distanz zum nächsten mittelwert punkten misst und diesen zuweist erhalten wir eine lineare trennung in anderen worten gibt es eine
  19. gerade linie welche die daten trend diese linie nennen wir jetzt mal decision boundary das problem ist nun aber dass diese linie zufällig dort
  20. liegt da wir ja die mittelwerte zufällig ausgewählt haben deswegen müssen wir die mittelwerte jetzt anpassen
  21. wir schauen jetzt einzeln auf jedes fragment der daten wir fangen mit der roten hälfte mal an und blendet alles andere aus für diesen
  22. teil berechnen wir dann den mittelpunkt und in dieser hälfte haben wir nur einen mittelpunkt und wir wissen ja wie man einen mittelpunkt berechnet zur
  23. erinnerung für jede dimension addieren wir die werte der daten punkte und teilen diese summe durch die anzahl der daten punkte das kommt dabei heraus
  24. gehen wir jetzt noch mal einen schritt zurück und gucken zudem auf den grünen teil der daten an auch hierfür berechnen wir einen neuen
  25. mittelwert in dem wir nur die grünen daten mit einbeziehen für beide mittelwerte sieht die veränderung also so aus
  26. im prinzip haben wir schon alle schritte die wir brauchen um die richtigen um die richtige decision brown rief für die trennung der beiden klassen zu bestimmen
  27. wir müssen jetzt nur alles wiederholen was wir wissen als wir das erste mal unsere stadt werte für die mittelwerte hatten haben wir ja
  28. die abstände von diesen daten punkt von diesem mittelpunkt zu jedem daten punkt gemessen diese haben wir dann dem jeweils
  29. nächsten mittelwert zugewiesen wenn wir dies noch mal machen dann verändert sich unsere linie im vergleich zu vorher und somit werden unsere daten anders
  30. getrennt das wiederum bedeutet dass für jeden teil der daten die mittelpunkte nicht richtig liegen und für diese erneut berechnen müssen
  31. das sieht dann so aus und jetzt wieder holen wir das ganze wieder und wieder wir berechnen jeden abstand weise in jedem daten punkt einen cluster zu und
  32. dann erhalten wir eine neue trennungslinie wenn wir das ganz oft wiederholen erreichen wie irgendwann einen punkt wo sich nichts mehr tut
  33. wir haben also eine konvergenz dies ist nun die beste trennungslinie die der algorithmus finden kann so wie es aussieht werden wir diese
  34. linie auch in dieser region vermuten wenn ihr schon andere videos auf diesem kanal über den em algorithmus gesehen
  35. habt habt ihr bestimmt erkannt dass dieses genau eine anwendung davon ist wenn wir unsere trennungslinie bestimmen ist dies genau der east app wenn wir
  36. unsere parameter aktualisieren hier die mittelwerte haben wir unseren emstek wir wiederholen diesen prozess bis zur konvergenz einige bemerkungen am ende
  37. der caymans algorithmus ist ein starkes werkzeug welches für viele anwendungen machine learning verwendet wird gerade wenn ihr mehr als zwei eigenschaften
  38. also dimensionen habt zum beispiel 10 dann ist es nicht mehr so einfach mit bloßem auge die mittelwerte zu erraten dass eben erklärt prinzip funktioniert
  39. für mehr als zwei klassen genau gleich natürlich hat dieser algorithmus auch seine nachteile und schwächen diese werde ich in einem anderen video
  40. erklären und außerdem werde ich noch über die mathematik hinter dem algorithmus sprechen und verschiedene anwendungs weisen
  41. und wie man diesen algorithmus implementieren und verbessern könnte vielen dank so weit fürs zuschauen und bis zum nächsten mal

Zum Nachlesen