Zum Inhalt springen
L

Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).

Clustering mit dem K-Means Algorithmus | Data Mining Algorithmen

David Thol5:11 14.688 Aufrufe veröffentlicht Auf YouTube

Das Wichtigste aus dem Video

Tipp auf eine Zeit – das Video springt genau dorthin.

Transkriptautomatisch erstellt · 37 Zeilen
Herunterladen
  1. hallo ich bin da wird und in diesem video möchte ich euch das clustering verfahren kam mittelwerte oder auf englisch kamins vorstellen
  2. zuerst stelle ich euch die funktionsweise von kevins vor danach geht es auf die vorteile und abschließen werde ich mit den nachteilen
  3. von kevins viel spaß beim lernen wie bei 1 klasse ring verfahren versuchen wir auch bei kamins aus einer menge von datenpunkten gruppen zu finden von
  4. datenpunkten sie sich sehr ähnlich sind die daten können verschiedenste sachen repräsentieren und die daten eintrag hat meistens mehrere eigenschaften so können
  5. wir zum beispiel einen datensatz haben von hunden mit deren körpergröße und deren gewicht wenn wir diesen beispiel datensatz und ein koordinatensystem
  6. eintragen können wir das ganze so aussehen wie man sieht zeichnen sich hier drei gruppen von hunden ab und diese wollen wir jetzt mit kamins
  7. automatisch erkennen dazu ist der erste schritt bei cummins das k festzulegen dass k gibt an wie viele cluster wie viele gruppen im
  8. endeffekt gefunden werden sollen das wäre in diesem fall 3 danach werden zufällig drei punkte im koordinatensystem bestimmt diese drei
  9. punkte sollen im endeffekt die mittelpunkte der cluster sein als nächstes wird dieser daten punkt seinem nächstgelegene mittelpunkt
  10. zugeordnet dadurch bilden sich jetzt um diese drei mittelpunkte preisklasse jetzt ist es aber meistens so dass diese mittel punkte gar nicht wirklich in der
  11. mitte dieses clusters liegen das müssen wir korrigieren indem wir alle daten punkte nehmen und dann zum beispiel von der x-achse also vom
  12. gewicht den durchschnitt bilden dann auch entsprechend von der größe der achse den durchschnitt bilden und dann den neuen mittelpunkt mit diesen
  13. durchschnitten bestimmen durch diese verschiebung kommt es immer wieder dazu dass nicht alle daten punkt gerichte zugeordnet sind also jetzt beginnen wir
  14. wieder jeden daten punkt wieder zu seinen nächstgelegenen mittelpunkt zuzuordnen danach verschieben wir wieder den mittelpunkt und das ganze geht so
  15. lange bis sich die mitte punkte wer verschieben am ende des algorithmus haben wir jetzt die drei mittelpunkt von den drei finalen clustern und alle daten
  16. punkte die zu diesen jeweiligen mittelpunkt dazu gehören also drei cluster das modell besteht letztendlich nur eben aus diesen drei im mittelpunkt
  17. werden wir jetzt zum beispiel aus diesem modell noch eine kreisliga c und machen wollen also eben einen neuen daten punkt zu
  18. diesen clustern den zuordnen wollen müssen wir lediglich schauen zu welchen dieser drei mittelpunkte besteht die kürzeste entfernung am anfang haben wir
  19. die startpunkte für die mittelpunkte zufällig bestimmt das kann dazu führen dass natürlich bei einer erneuten ausführung also mit anderen staat
  20. punkten für die mittelpunkte ganz andere ergebnisse ganz andere cluster herauskommen deswegen kann man diesen algorithmus mehrmals durchführen und
  21. sich dann für die beste lösung entscheiden kommen wir zu den vorteilen von kevins zum eines kamins ein sehr einfacher
  22. algorithmus der auch sehr leicht zu programmieren ist und natürlich auch sehr leicht verständlich und interpretierbar ist
  23. außerdem ist gaming noch sehr effizient die laufzeit des kamins steigt lediglich linear mit der anzahl an durchläufen mit der anzahl an clustern und mit der
  24. anzahl an daten punkten die man hat das bedeutet dass kevins auch mit großen datenmengen gut skalieren kann nicht so wie es bei dem klassifikations verfahren
  25. kann nächsten nachbarn und der fall ist allerdings hat chemnitz auch einige nachteile zum beispiel ist ein großer nachteil dass man im vornherein wissen
  26. muss wie viele klassen wie viele gruppen man überhaupt hat in unserem beispiel müsse man eben davor wissen dass es drei verschiedene rassen gibt und die
  27. wahrscheinlichste drei cluster bilden in mainz den anwendungsfällen kann man das aber nicht unbedingt im vorhinein schon sagen
  28. außerdem ist chemisch sehr anfällig für rausch punkte vorsprung sind punkte die sehr weit von der masse der daten punkt entfernt sind
  29. aber natürlich haben diese rausch punkte auch einen einfluss auf die mittelpunkte werden des algorithmus verziehen somit die cluster und letztendlich ist der
  30. cummins algorithmus natürlich auch sehr abhängig von den initialen mittel punkten die erst mal zufällig bestimmt werden
  31. wie bereits gesagt führen unterschiedliche anfangs punkte auch zu unterschiedlichen ergebnissen dann muss man sich natürlich entscheiden
  32. was ersetzt das richtige ergebnis bilde ich irgendwie ein durchschnitt oder nämlich das häufigste ergebnis wie geht man da genau vor trotz alledem ist der
  33. chemnitzer rhythmus ein sehr populärer algorithmus gerade wegen seiner einfachheit und wegen der effizienz um die gruppen zu bestimmen
  34. zumindest wenn man die anzahl der gruppen von vornherein schon weiß so viel zu dem clustering verfahren kamins letzte woche habe ich ein video zu dem
  35. klassifikations verfahren kann nächsten nachbarn gemacht oder auch kein ihres neighbours das verlinke ich euch betrügen auf der seite wenn euch dieses
  36. video gefallen hat dann würde ich mich sehr freuen wenn er dem video einen daumen nach oben gibt ansonsten viel spaß beim lernen und bis zum nächsten
  37. video

Zum Nachlesen