Clustering mit dem K-Means Algorithmus | Data Mining Algorithmen David Thol https://www.youtube.com/watch?v=AQ1nAiaYBIc Transkript (automatisch erstellt) 0:00 hallo ich bin da wird und in diesem video möchte ich euch das clustering verfahren kam mittelwerte oder auf englisch kamins vorstellen 0:07 zuerst stelle ich euch die funktionsweise von kevins vor danach geht es auf die vorteile und abschließen werde ich mit den nachteilen 0:15 von kevins viel spaß beim lernen wie bei 1 klasse ring verfahren versuchen wir auch bei kamins aus einer menge von datenpunkten gruppen zu finden von 0:26 datenpunkten sie sich sehr ähnlich sind die daten können verschiedenste sachen repräsentieren und die daten eintrag hat meistens mehrere eigenschaften so können 0:36 wir zum beispiel einen datensatz haben von hunden mit deren körpergröße und deren gewicht wenn wir diesen beispiel datensatz und ein koordinatensystem 0:45 eintragen können wir das ganze so aussehen wie man sieht zeichnen sich hier drei gruppen von hunden ab und diese wollen wir jetzt mit kamins 0:53 automatisch erkennen dazu ist der erste schritt bei cummins das k festzulegen dass k gibt an wie viele cluster wie viele gruppen im 1:02 endeffekt gefunden werden sollen das wäre in diesem fall 3 danach werden zufällig drei punkte im koordinatensystem bestimmt diese drei 1:12 punkte sollen im endeffekt die mittelpunkte der cluster sein als nächstes wird dieser daten punkt seinem nächstgelegene mittelpunkt 1:21 zugeordnet dadurch bilden sich jetzt um diese drei mittelpunkte preisklasse jetzt ist es aber meistens so dass diese mittel punkte gar nicht wirklich in der 1:31 mitte dieses clusters liegen das müssen wir korrigieren indem wir alle daten punkte nehmen und dann zum beispiel von der x-achse also vom 1:39 gewicht den durchschnitt bilden dann auch entsprechend von der größe der achse den durchschnitt bilden und dann den neuen mittelpunkt mit diesen 1:47 durchschnitten bestimmen durch diese verschiebung kommt es immer wieder dazu dass nicht alle daten punkt gerichte zugeordnet sind also jetzt beginnen wir 1:55 wieder jeden daten punkt wieder zu seinen nächstgelegenen mittelpunkt zuzuordnen danach verschieben wir wieder den mittelpunkt und das ganze geht so 2:05 lange bis sich die mitte punkte wer verschieben am ende des algorithmus haben wir jetzt die drei mittelpunkt von den drei finalen clustern und alle daten 2:15 punkte die zu diesen jeweiligen mittelpunkt dazu gehören also drei cluster das modell besteht letztendlich nur eben aus diesen drei im mittelpunkt 2:25 werden wir jetzt zum beispiel aus diesem modell noch eine kreisliga c und machen wollen also eben einen neuen daten punkt zu 2:32 diesen clustern den zuordnen wollen müssen wir lediglich schauen zu welchen dieser drei mittelpunkte besteht die kürzeste entfernung am anfang haben wir 2:41 die startpunkte für die mittelpunkte zufällig bestimmt das kann dazu führen dass natürlich bei einer erneuten ausführung also mit anderen staat 2:49 punkten für die mittelpunkte ganz andere ergebnisse ganz andere cluster herauskommen deswegen kann man diesen algorithmus mehrmals durchführen und 2:58 sich dann für die beste lösung entscheiden kommen wir zu den vorteilen von kevins zum eines kamins ein sehr einfacher 3:05 algorithmus der auch sehr leicht zu programmieren ist und natürlich auch sehr leicht verständlich und interpretierbar ist 3:11 außerdem ist gaming noch sehr effizient die laufzeit des kamins steigt lediglich linear mit der anzahl an durchläufen mit der anzahl an clustern und mit der 3:23 anzahl an daten punkten die man hat das bedeutet dass kevins auch mit großen datenmengen gut skalieren kann nicht so wie es bei dem klassifikations verfahren 3:32 kann nächsten nachbarn und der fall ist allerdings hat chemnitz auch einige nachteile zum beispiel ist ein großer nachteil dass man im vornherein wissen 3:42 muss wie viele klassen wie viele gruppen man überhaupt hat in unserem beispiel müsse man eben davor wissen dass es drei verschiedene rassen gibt und die 3:50 wahrscheinlichste drei cluster bilden in mainz den anwendungsfällen kann man das aber nicht unbedingt im vorhinein schon sagen 3:56 außerdem ist chemisch sehr anfällig für rausch punkte vorsprung sind punkte die sehr weit von der masse der daten punkt entfernt sind 4:04 aber natürlich haben diese rausch punkte auch einen einfluss auf die mittelpunkte werden des algorithmus verziehen somit die cluster und letztendlich ist der 4:13 cummins algorithmus natürlich auch sehr abhängig von den initialen mittel punkten die erst mal zufällig bestimmt werden 4:20 wie bereits gesagt führen unterschiedliche anfangs punkte auch zu unterschiedlichen ergebnissen dann muss man sich natürlich entscheiden 4:28 was ersetzt das richtige ergebnis bilde ich irgendwie ein durchschnitt oder nämlich das häufigste ergebnis wie geht man da genau vor trotz alledem ist der 4:37 chemnitzer rhythmus ein sehr populärer algorithmus gerade wegen seiner einfachheit und wegen der effizienz um die gruppen zu bestimmen 4:45 zumindest wenn man die anzahl der gruppen von vornherein schon weiß so viel zu dem clustering verfahren kamins letzte woche habe ich ein video zu dem 4:53 klassifikations verfahren kann nächsten nachbarn gemacht oder auch kein ihres neighbours das verlinke ich euch betrügen auf der seite wenn euch dieses 5:02 video gefallen hat dann würde ich mich sehr freuen wenn er dem video einen daumen nach oben gibt ansonsten viel spaß beim lernen und bis zum nächsten 5:09 video