Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
Klassifikation mit dem k-Nächste-Nachbarn Algorithmus | Data Mining Algorithmen
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 31 Zeilen
- hallo mein name ist david und heute möchte ich euch einen einfachen algorithmus zur klassifikation vorstellen und zwar den nächsten
- nachbarn algorithmus oder kurz k n m zuerst gehe ich auf die funktionsweise von keiner hinein danach möchte ich euch die vorteile vorstellen und abschließend
- möchte ich euch ja auch die nachteile von keimen präsentieren viel spaß beim lernen wie bei allen klassifikations algorithmen haben wir
- auch hier einen datensatz bei denen jeder eintrag mehrere eigenschaften hat und auch jeweils eine klasse beispielsweise könnten wir uns da einen
- datensatz von kunden anlegen als eigenschaften könnte er dann zum beispiel die höhe und das gewicht des hundes haben als klasse zb dann die
- farbe in einem vereinfachten beispiel könnten die farben braun und schwarz sein in einem koordinatensystem abgetragen
- könnten dann unsere bereits bestehenden daten so aussehen wir haben als auf der x-achse das gewicht und auf der y-achse die größe des hundes die aufgabe von
- unserer klassifikation von unserem classic erziehungsmodell soll es dann sein für einen neuen hund von dem wir nur die größe und das gewicht wissen
- eine vermutung anzustellen was denn wohl die farbe dieses hundes sein wird ein solcher hund könnte im koordinatensystem zb hier liegen wie der name des
- algorithmus kann ich's nachbarn schon vermuten lässt müssen wir zunächst ein kabel stimmen zum beispiel drei und dann suchen wir uns die drei nächsten
- nachbarn des unbekannten hundes anhand dieser drei nachbarn können wir dann vermuten was wohl die farbe des unbekannten hundes ist das können wir
- zum beispiel mit einem voting machen also welche farbe hat die mehrzahl in unserem beispiel hätten wir dann zwei schwarze und einen braunen nachbarn also
- werden wir vermuten dass der unbekannte hund auch die farbe schwarz hat das modell das wir haben besteht quasi aus allen trainings daten also nicht wie bei
- der regression oder bei neuronalen netzen trainieren wir extra parameter wie irgendwelche gewichte oder sowas und unserem modell aufzustellen sondern
- wirklich alle trainings daten bilden unsere mutter somit haben wir quasi auch ein trainingszeit also ein ziemlich
- einfaches verfahren kommen wir zu den vorteilen von keinen ein großer vorteil ist natürlich dass wir quasi keinen trainingszeit haben weißt du ja nicht
- noch einen extra modell trainieren außerdem ist es ein sehr einfaches modell das sehr leicht zu verstehen ist auch sehr einfach zu programmieren und
- im endeffekt auch nur sehr wenig rechenleistung braucht um grundlegend zu funktionieren was sind die nachteile von keimen zum
- einen ist es war cool dass wir keine trainings zeit brauchen aber auf der anderen seite wird natürlich die klassifikations zeit dadurch sehr hoch
- weil wir natürlich wenn wir sehr viele daten haben müssen wir um die nachbarn zu finden erst alle daten einträge durchgehend für 1.000 einträge geht es
- vielleicht auch sehr schnell aber für eine million einträge dauert das natürlich schon viel länger alle daten durchzugehen um die entsprechenden
- nachbarn zu finden ein weiterer schwachpunkt ist dass wir das carl erstmal bestimmen müssen also wie viele nachbarn berücksichtigen wir
- das kann man aber gut durch testen indem man noch ein trainings datensatz nimmt und dann verschiedene fast durchprobiert welche die besten genauigkeiten liefern
- ein dritter nachteil oder ein drittes schwierigkeit besteht darin dass wir festlegen müssen wie wir die abstände zwischen den datenpunkten bestimmen
- können wir zum beispiel bei unseren hunden zehn zentimeter höhenunterschied gleichsetzen mit zehn kilo gramm gewichtsunterschied oder ist er zehn
- zentimeter höhenunterschied gleichzusetzen mit einem kilo gramm gewichtsunterschied über sowas muss man sich dann gedanken machen und eine
- entsprechende skala bzw eine entsprechende normierung finden natürlich kann das auch wieder anhand eines trainings datensatzes getestet
- werden was da die beste normierung die best skala ist abschließend ist zu sagen dass keinen ein sehr einfacher algorithmus ist der
- keine trainingszeit benötigt aber dafür sehr viel zeit bei der klassifikation benötigt und vor allem sehr ungeeignet für sehr große datenmengen ist im
- nächsten video möchte ich euch mal ein einfaches clustering verfahren vorstellen wenn euch dieses video hier gefallen hat und ihr auch das nächste
- video nicht verpassen wollt dann abonniert doch gerne den kanal ansonsten viel spaß beim lernen und bis zum nächsten video
Zum Nachlesen
KlassifikationsverfahrenDas Erzeugen von Strukturen aus vorhandenen Daten wird auch als Mustererkennung, Diskriminierung oder überwachtes Lernen bezeichnet. Dabei werden …
ClusteranalyseUnter Clusteranalyse (Clustering-Algorithmus, gelegentlich auch: Ballungsanalyse) versteht man ein Verfahren zur Entdeckung von Ähnlichkeitsstrukturen in …
K-Means-AlgorithmusEin k-Means-Algorithmus ist ein Verfahren zur Vektorquantisierung, das auch zur Clusteranalyse verwendet wird. Dabei wird aus einer Menge von ähnlichen …