Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
Clustering mit dem K-Means Algorithmus | Data Mining Algorithmen
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 37 Zeilen
- hallo ich bin da wird und in diesem video möchte ich euch das clustering verfahren kam mittelwerte oder auf englisch kamins vorstellen
- zuerst stelle ich euch die funktionsweise von kevins vor danach geht es auf die vorteile und abschließen werde ich mit den nachteilen
- von kevins viel spaß beim lernen wie bei 1 klasse ring verfahren versuchen wir auch bei kamins aus einer menge von datenpunkten gruppen zu finden von
- datenpunkten sie sich sehr ähnlich sind die daten können verschiedenste sachen repräsentieren und die daten eintrag hat meistens mehrere eigenschaften so können
- wir zum beispiel einen datensatz haben von hunden mit deren körpergröße und deren gewicht wenn wir diesen beispiel datensatz und ein koordinatensystem
- eintragen können wir das ganze so aussehen wie man sieht zeichnen sich hier drei gruppen von hunden ab und diese wollen wir jetzt mit kamins
- automatisch erkennen dazu ist der erste schritt bei cummins das k festzulegen dass k gibt an wie viele cluster wie viele gruppen im
- endeffekt gefunden werden sollen das wäre in diesem fall 3 danach werden zufällig drei punkte im koordinatensystem bestimmt diese drei
- punkte sollen im endeffekt die mittelpunkte der cluster sein als nächstes wird dieser daten punkt seinem nächstgelegene mittelpunkt
- zugeordnet dadurch bilden sich jetzt um diese drei mittelpunkte preisklasse jetzt ist es aber meistens so dass diese mittel punkte gar nicht wirklich in der
- mitte dieses clusters liegen das müssen wir korrigieren indem wir alle daten punkte nehmen und dann zum beispiel von der x-achse also vom
- gewicht den durchschnitt bilden dann auch entsprechend von der größe der achse den durchschnitt bilden und dann den neuen mittelpunkt mit diesen
- durchschnitten bestimmen durch diese verschiebung kommt es immer wieder dazu dass nicht alle daten punkt gerichte zugeordnet sind also jetzt beginnen wir
- wieder jeden daten punkt wieder zu seinen nächstgelegenen mittelpunkt zuzuordnen danach verschieben wir wieder den mittelpunkt und das ganze geht so
- lange bis sich die mitte punkte wer verschieben am ende des algorithmus haben wir jetzt die drei mittelpunkt von den drei finalen clustern und alle daten
- punkte die zu diesen jeweiligen mittelpunkt dazu gehören also drei cluster das modell besteht letztendlich nur eben aus diesen drei im mittelpunkt
- werden wir jetzt zum beispiel aus diesem modell noch eine kreisliga c und machen wollen also eben einen neuen daten punkt zu
- diesen clustern den zuordnen wollen müssen wir lediglich schauen zu welchen dieser drei mittelpunkte besteht die kürzeste entfernung am anfang haben wir
- die startpunkte für die mittelpunkte zufällig bestimmt das kann dazu führen dass natürlich bei einer erneuten ausführung also mit anderen staat
- punkten für die mittelpunkte ganz andere ergebnisse ganz andere cluster herauskommen deswegen kann man diesen algorithmus mehrmals durchführen und
- sich dann für die beste lösung entscheiden kommen wir zu den vorteilen von kevins zum eines kamins ein sehr einfacher
- algorithmus der auch sehr leicht zu programmieren ist und natürlich auch sehr leicht verständlich und interpretierbar ist
- außerdem ist gaming noch sehr effizient die laufzeit des kamins steigt lediglich linear mit der anzahl an durchläufen mit der anzahl an clustern und mit der
- anzahl an daten punkten die man hat das bedeutet dass kevins auch mit großen datenmengen gut skalieren kann nicht so wie es bei dem klassifikations verfahren
- kann nächsten nachbarn und der fall ist allerdings hat chemnitz auch einige nachteile zum beispiel ist ein großer nachteil dass man im vornherein wissen
- muss wie viele klassen wie viele gruppen man überhaupt hat in unserem beispiel müsse man eben davor wissen dass es drei verschiedene rassen gibt und die
- wahrscheinlichste drei cluster bilden in mainz den anwendungsfällen kann man das aber nicht unbedingt im vorhinein schon sagen
- außerdem ist chemisch sehr anfällig für rausch punkte vorsprung sind punkte die sehr weit von der masse der daten punkt entfernt sind
- aber natürlich haben diese rausch punkte auch einen einfluss auf die mittelpunkte werden des algorithmus verziehen somit die cluster und letztendlich ist der
- cummins algorithmus natürlich auch sehr abhängig von den initialen mittel punkten die erst mal zufällig bestimmt werden
- wie bereits gesagt führen unterschiedliche anfangs punkte auch zu unterschiedlichen ergebnissen dann muss man sich natürlich entscheiden
- was ersetzt das richtige ergebnis bilde ich irgendwie ein durchschnitt oder nämlich das häufigste ergebnis wie geht man da genau vor trotz alledem ist der
- chemnitzer rhythmus ein sehr populärer algorithmus gerade wegen seiner einfachheit und wegen der effizienz um die gruppen zu bestimmen
- zumindest wenn man die anzahl der gruppen von vornherein schon weiß so viel zu dem clustering verfahren kamins letzte woche habe ich ein video zu dem
- klassifikations verfahren kann nächsten nachbarn gemacht oder auch kein ihres neighbours das verlinke ich euch betrügen auf der seite wenn euch dieses
- video gefallen hat dann würde ich mich sehr freuen wenn er dem video einen daumen nach oben gibt ansonsten viel spaß beim lernen und bis zum nächsten
- video
Zum Nachlesen
Data ScienceDer Begriff Data Science (dt. etwa Datenwissenschaft) bezeichnet die Wissenschaft von der Extraktion von Wissen aus Daten, um daraus zu lernen.
AlgorithmusAlgorithmen bestehen aus endlich vielen, wohldefinierten Einzelschritten. ... Damit können sie zur Ausführung in ein Computerprogramm implementiert, aber auch in …
DatenDaten bezeichnet als Plural von Datum Fakten, Zeitpunkte oder kalendarische Zeitangaben. Als Pluralwort steht es für durch Beobachtungen, Messungen u. a.