Klassifikation mit dem k-Nächste-Nachbarn Algorithmus | Data Mining Algorithmen David Thol https://www.youtube.com/watch?v=1ZlshNYxeo4 Transkript (automatisch erstellt) 0:00 hallo mein name ist david und heute möchte ich euch einen einfachen algorithmus zur klassifikation vorstellen und zwar den nächsten 0:07 nachbarn algorithmus oder kurz k n m zuerst gehe ich auf die funktionsweise von keiner hinein danach möchte ich euch die vorteile vorstellen und abschließend 0:16 möchte ich euch ja auch die nachteile von keimen präsentieren viel spaß beim lernen wie bei allen klassifikations algorithmen haben wir 0:25 auch hier einen datensatz bei denen jeder eintrag mehrere eigenschaften hat und auch jeweils eine klasse beispielsweise könnten wir uns da einen 0:34 datensatz von kunden anlegen als eigenschaften könnte er dann zum beispiel die höhe und das gewicht des hundes haben als klasse zb dann die 0:43 farbe in einem vereinfachten beispiel könnten die farben braun und schwarz sein in einem koordinatensystem abgetragen 0:51 könnten dann unsere bereits bestehenden daten so aussehen wir haben als auf der x-achse das gewicht und auf der y-achse die größe des hundes die aufgabe von 1:03 unserer klassifikation von unserem classic erziehungsmodell soll es dann sein für einen neuen hund von dem wir nur die größe und das gewicht wissen 1:11 eine vermutung anzustellen was denn wohl die farbe dieses hundes sein wird ein solcher hund könnte im koordinatensystem zb hier liegen wie der name des 1:21 algorithmus kann ich's nachbarn schon vermuten lässt müssen wir zunächst ein kabel stimmen zum beispiel drei und dann suchen wir uns die drei nächsten 1:30 nachbarn des unbekannten hundes anhand dieser drei nachbarn können wir dann vermuten was wohl die farbe des unbekannten hundes ist das können wir 1:39 zum beispiel mit einem voting machen also welche farbe hat die mehrzahl in unserem beispiel hätten wir dann zwei schwarze und einen braunen nachbarn also 1:49 werden wir vermuten dass der unbekannte hund auch die farbe schwarz hat das modell das wir haben besteht quasi aus allen trainings daten also nicht wie bei 1:59 der regression oder bei neuronalen netzen trainieren wir extra parameter wie irgendwelche gewichte oder sowas und unserem modell aufzustellen sondern 2:06 wirklich alle trainings daten bilden unsere mutter somit haben wir quasi auch ein trainingszeit also ein ziemlich 2:12 einfaches verfahren kommen wir zu den vorteilen von keinen ein großer vorteil ist natürlich dass wir quasi keinen trainingszeit haben weißt du ja nicht 2:21 noch einen extra modell trainieren außerdem ist es ein sehr einfaches modell das sehr leicht zu verstehen ist auch sehr einfach zu programmieren und 2:29 im endeffekt auch nur sehr wenig rechenleistung braucht um grundlegend zu funktionieren was sind die nachteile von keimen zum 2:38 einen ist es war cool dass wir keine trainings zeit brauchen aber auf der anderen seite wird natürlich die klassifikations zeit dadurch sehr hoch 2:46 weil wir natürlich wenn wir sehr viele daten haben müssen wir um die nachbarn zu finden erst alle daten einträge durchgehend für 1.000 einträge geht es 2:55 vielleicht auch sehr schnell aber für eine million einträge dauert das natürlich schon viel länger alle daten durchzugehen um die entsprechenden 3:02 nachbarn zu finden ein weiterer schwachpunkt ist dass wir das carl erstmal bestimmen müssen also wie viele nachbarn berücksichtigen wir 3:10 das kann man aber gut durch testen indem man noch ein trainings datensatz nimmt und dann verschiedene fast durchprobiert welche die besten genauigkeiten liefern 3:19 ein dritter nachteil oder ein drittes schwierigkeit besteht darin dass wir festlegen müssen wie wir die abstände zwischen den datenpunkten bestimmen 3:28 können wir zum beispiel bei unseren hunden zehn zentimeter höhenunterschied gleichsetzen mit zehn kilo gramm gewichtsunterschied oder ist er zehn 3:38 zentimeter höhenunterschied gleichzusetzen mit einem kilo gramm gewichtsunterschied über sowas muss man sich dann gedanken machen und eine 3:45 entsprechende skala bzw eine entsprechende normierung finden natürlich kann das auch wieder anhand eines trainings datensatzes getestet 3:53 werden was da die beste normierung die best skala ist abschließend ist zu sagen dass keinen ein sehr einfacher algorithmus ist der 4:01 keine trainingszeit benötigt aber dafür sehr viel zeit bei der klassifikation benötigt und vor allem sehr ungeeignet für sehr große datenmengen ist im 4:11 nächsten video möchte ich euch mal ein einfaches clustering verfahren vorstellen wenn euch dieses video hier gefallen hat und ihr auch das nächste 4:18 video nicht verpassen wollt dann abonniert doch gerne den kanal ansonsten viel spaß beim lernen und bis zum nächsten video