Überwachtes Lernen (Supervised Learning) einfach erklärt! - Machine Learning Grundlagen datasolut https://www.youtube.com/watch?v=BkDUDi6YDaU Transkript (automatisch erstellt) 0:00 herzlich willkommen mein Name ist la Wutke und ich möchte dir zeigen was supervised learning bedeutet überwachtes lernen auf Deutsch übersetzt ist eine 0:08 machine learning Methode die anhand von Beispielen Muster und Zusammenhänge erkennt und dann auf unbekannte Daten angewendet werden kann um so Prognosen 0:19 und Vorhersagen für die Zukunft zu treffen Beispiele für supervis learning sind z.B die betrugserkennung die Bilderkennung oder die Vorhersage von 0:28 numerischen Werten wie z.B einer Umsatzprognose für die nächsten Monate ich würde dir gerne an einem Beispiel zeigen wie supervised learning 0:36 funktioniert falls Du unser machine learning Einführungsvideo noch nicht gesehen hast schau dir doch vielleicht einfach an ich verlinke das mal hier 0:42 oben lass uns direkt in das Beispiel einsteigen ich habe hier ein datens Set mitgebracht am Beispiel von einer Klassifikation also versuchen eine 0:51 Variable vorherzusagen die heißt hier y und H hat die Ausprägung yes and no es sind Bankdaten das aus einem ganz bekannten machine learning DataSet 1:02 Repository des UCI Repository das findest du im Internet ich verlinke das auch mal hier in dem Video und wir haben hier ganz viele variaben Prädiktoren die 1:11 sozusagen diese Zielvariable beschreiben wir haben hier das Alter des Kunden wir haben den Job wir haben sagen ja ist der der 1:21 Familienstand wir haben weitere Informationen zur zur Bildung wie viel Geld hat er auf seinem Konto und so weiter und so fort 1:28 und wir versuchen so zzusagen hier mit dem machine learning Algorithmus diese Variable hier anzutrainieren also ob er jetzt z.B ich glaube das an einem 1:36 Beispiel von von einer Direktmarketing Kampagne und wollen vorher sagen ob jemand affin ist für diese Direktmarketing Kampagne bzw wie gut er 1:45 auf diese Direktmarketing Kampagne reagiert und wir haben h diese Beispieldaten und aus diesem Beispieldaten können wir dann lernen ein 1:52 Modell erstellen wir geben diese Beispieldaten hier rein W wir wählen einen passenden Algorithmus aus das kann jetzt z z.B eine ganz normale 2:01 logistische Regression sein oder ein etwas komplexeres Verfahren wie z.B random forest oder ein XG Boost der trainiert dieses Muster an und wir 2:11 bekommen ein Modell als Ausgabe und es kommen neue Daten von neue Daten müssen dann bewertet werden und hier kriegen wir dann sozusagen durch diese Bewertung 2:20 des Algorithmus Wahrscheinlichkeiten raus die sagen wie wahrscheinlich ist es dass Person X auf diese Direktmarketing Kampagne reagiert 2:31 jetzt lass uns als nächstes auf den eigentlichen Prozess gucken ich habe hier mal das Beispiel mitgebracht an einer zweidimensionalen Grafik ihr hab 2:40 gesehen in so einem Modell sind hunderte variaaben drin in unserem Beispiel waren es jetzt weiß nicht 20 aber in der in der Praxis sind es teilweise bis zu 2:49 mehreren Hundt und der Algorithmus versucht jetzt sozusagen zwischen diesen zwei Klassen die beste Trennung zu finden und idealerweise findet er hier 2:58 ein ich mal einen guten Weg diese zwei Klassen von voneinander zu separieren natürlich mit einem mit einem kleinen Fehler also hier in dem Fall hätte er 3:08 natürlich diese zwei Klassen oder diese zwei Elemente Datenset in diesem Datenset halt nicht richtig klassifiziert aber man versucht 3:17 natürlich das Modell so zu trainieren dass es möglichst gut generalisierbar ist aber nicht zu stark auf dieses Datenset an sich ja gefittet wird man 3:27 nennt es fitting im im im Data science Bereich weil das würde zu einem Prozess führen der der sich overfitting nennt ich möchte es auch mal ganz kurz an 3:34 einem Beispiel zeigen was overfitting ist overfitting würde bedeuten der Algorithmus würde jetzt hier eine perfekte Trennung zwischen den Klassen 3:42 finden und sozusagen viel zu gut das trainingsdatenset an anlernen und ja somit so ein bisschen in also eigentlich in der Praxis nicht wirklich anwendbar 3:53 wäre weil es sozusagen die Trainingsdaten perfekt gelernt hat aber nicht generalisierbar ist es ist in der Praxis um das zu vermeiden versucht man 4:01 natürlich möglichst einen einen einen guten fit hier in den Daten zu finden wir können euch vorstellen bei hten variaaben kann man das jetzt hier nicht 4:09 mehr aufzeigen aber an diesen zwei Achsen ist es doch ganz einfach zu verstehen und relativ plastisch aufzuzeigen um das overfitting zu 4:18 vermeiden und ein gut generalisierbares Modell zu erhalten gibt's eine ganz einfache Lösung wir teilen das Datenset mindestens mal in zwei verschiedene 4:27 Datensets auf also wir haben das trainingsdatenset hier und natürlich die Zielvariable wird häufig auch noch mal abgetrennt in den Prozess aber wir haben 4:36 halt auch hier das testdatenset und die testzielvariable das führt dazu dass wir sozusagen dem Algorithmus nur das trainingsdatenset geben zur zum zum 4:47 Trainieren zum Lernen und das testdatenset explizit dafür da ist um zu sagen wie gut funktioniert eigentlich dieser Algorithmus auf den Daten die er 4:57 noch gar nicht kennt und wir haben sozusagen ja auch für unsere Testdaten die Zielvariable und können dann einfach auch an ganz objektiven Metriken 5:04 abmessen wie gut unser Modell jetzt in unserem klassifizierungsbeispiel ja Klasse 1 von Klasse 2 trennen kann und wie gut es die 5:12 ja die Ereignisse vielleicht auch sortieren kann häufig wird supervised learning auch gegen dann den gegen den Gegenpart 5:21 das unsupervvised learning verglichen ich möchte das hier auch noch mal ganz kurz mit Dir teilen supervised learning ist sozusagen wenn man zwei oder mehrere 5:30 Klassen hat oder einen numerischen Wert hat den man klar vorhersagen kann auch antrainieren kann beim unupvis learning ist es eigentlich ganz anders es gibt 5:38 keine klare Zielvariable man möchte sozusagen in der Regel den Algorithmus Strukturen und Muster in den Daten erkennen lassen ganz eigenständig ohne 5:49 sozusagen ohne ohne viel Menschliches zuun und ja das sind die größten Unterschieden Unterschiede dieser dieser zwei Verfahren oder Methoden des des 5:58 Machinen ich hoffe dir hat das Video gefallen und du hast heute was gelernt schau doch auch in ein dem un supervis learning 6:06 Video vorbei wo ich noch mal genau im Detail erkläre was an supervis learning ist und ja wenn du Bock hast folge doch diesem 6:19 Kanal