Zum Inhalt springen
L

Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).

Klassifikation mit dem k-Nächste-Nachbarn Algorithmus | Data Mining Algorithmen

David Thol4:26 13.878 Aufrufe veröffentlicht Auf YouTube

Das Wichtigste aus dem Video

Tipp auf eine Zeit – das Video springt genau dorthin.

Transkriptautomatisch erstellt · 31 Zeilen
Herunterladen
  1. hallo mein name ist david und heute möchte ich euch einen einfachen algorithmus zur klassifikation vorstellen und zwar den nächsten
  2. nachbarn algorithmus oder kurz k n m zuerst gehe ich auf die funktionsweise von keiner hinein danach möchte ich euch die vorteile vorstellen und abschließend
  3. möchte ich euch ja auch die nachteile von keimen präsentieren viel spaß beim lernen wie bei allen klassifikations algorithmen haben wir
  4. auch hier einen datensatz bei denen jeder eintrag mehrere eigenschaften hat und auch jeweils eine klasse beispielsweise könnten wir uns da einen
  5. datensatz von kunden anlegen als eigenschaften könnte er dann zum beispiel die höhe und das gewicht des hundes haben als klasse zb dann die
  6. farbe in einem vereinfachten beispiel könnten die farben braun und schwarz sein in einem koordinatensystem abgetragen
  7. könnten dann unsere bereits bestehenden daten so aussehen wir haben als auf der x-achse das gewicht und auf der y-achse die größe des hundes die aufgabe von
  8. unserer klassifikation von unserem classic erziehungsmodell soll es dann sein für einen neuen hund von dem wir nur die größe und das gewicht wissen
  9. eine vermutung anzustellen was denn wohl die farbe dieses hundes sein wird ein solcher hund könnte im koordinatensystem zb hier liegen wie der name des
  10. algorithmus kann ich's nachbarn schon vermuten lässt müssen wir zunächst ein kabel stimmen zum beispiel drei und dann suchen wir uns die drei nächsten
  11. nachbarn des unbekannten hundes anhand dieser drei nachbarn können wir dann vermuten was wohl die farbe des unbekannten hundes ist das können wir
  12. zum beispiel mit einem voting machen also welche farbe hat die mehrzahl in unserem beispiel hätten wir dann zwei schwarze und einen braunen nachbarn also
  13. werden wir vermuten dass der unbekannte hund auch die farbe schwarz hat das modell das wir haben besteht quasi aus allen trainings daten also nicht wie bei
  14. der regression oder bei neuronalen netzen trainieren wir extra parameter wie irgendwelche gewichte oder sowas und unserem modell aufzustellen sondern
  15. wirklich alle trainings daten bilden unsere mutter somit haben wir quasi auch ein trainingszeit also ein ziemlich
  16. einfaches verfahren kommen wir zu den vorteilen von keinen ein großer vorteil ist natürlich dass wir quasi keinen trainingszeit haben weißt du ja nicht
  17. noch einen extra modell trainieren außerdem ist es ein sehr einfaches modell das sehr leicht zu verstehen ist auch sehr einfach zu programmieren und
  18. im endeffekt auch nur sehr wenig rechenleistung braucht um grundlegend zu funktionieren was sind die nachteile von keimen zum
  19. einen ist es war cool dass wir keine trainings zeit brauchen aber auf der anderen seite wird natürlich die klassifikations zeit dadurch sehr hoch
  20. weil wir natürlich wenn wir sehr viele daten haben müssen wir um die nachbarn zu finden erst alle daten einträge durchgehend für 1.000 einträge geht es
  21. vielleicht auch sehr schnell aber für eine million einträge dauert das natürlich schon viel länger alle daten durchzugehen um die entsprechenden
  22. nachbarn zu finden ein weiterer schwachpunkt ist dass wir das carl erstmal bestimmen müssen also wie viele nachbarn berücksichtigen wir
  23. das kann man aber gut durch testen indem man noch ein trainings datensatz nimmt und dann verschiedene fast durchprobiert welche die besten genauigkeiten liefern
  24. ein dritter nachteil oder ein drittes schwierigkeit besteht darin dass wir festlegen müssen wie wir die abstände zwischen den datenpunkten bestimmen
  25. können wir zum beispiel bei unseren hunden zehn zentimeter höhenunterschied gleichsetzen mit zehn kilo gramm gewichtsunterschied oder ist er zehn
  26. zentimeter höhenunterschied gleichzusetzen mit einem kilo gramm gewichtsunterschied über sowas muss man sich dann gedanken machen und eine
  27. entsprechende skala bzw eine entsprechende normierung finden natürlich kann das auch wieder anhand eines trainings datensatzes getestet
  28. werden was da die beste normierung die best skala ist abschließend ist zu sagen dass keinen ein sehr einfacher algorithmus ist der
  29. keine trainingszeit benötigt aber dafür sehr viel zeit bei der klassifikation benötigt und vor allem sehr ungeeignet für sehr große datenmengen ist im
  30. nächsten video möchte ich euch mal ein einfaches clustering verfahren vorstellen wenn euch dieses video hier gefallen hat und ihr auch das nächste
  31. video nicht verpassen wollt dann abonniert doch gerne den kanal ansonsten viel spaß beim lernen und bis zum nächsten video

Zum Nachlesen