Entscheidungsbaum einfach erklärt – Predictive Analytics mit Beispiel numiqo - Deutsch https://www.youtube.com/watch?v=qW4YD1ac0Ao Transkript (automatisch erstellt) 0:00 In diesem Video geht es um den Entscheidungsbaum. Also, was ist ein Entscheidungsbaum? Die Grundidee ist einfach, ein 0:08 Entscheidungsbaum soll uns helfen mit Hilfe von vorhandenen Daten eine Vorhersage für neue Daten zu machen. Also einfach gesagt, wir haben 0:17 vorhandene Daten, mit deren Hilfe wir einen Entscheidungsbaum erstellen. Diesen Entscheidungsbaum können wir dann verwenden, um für neue Daten eine 0:26 Vorhersage zu machen. Aber wie geht das? Wie wird der Entscheidungsbaum erstellt? Schauen wir uns das an einem Beispiel an. Sagen wir, du arbeitest bei Netflix 0:36 und du möchtest wissen, ob ein Kunde wahrscheinlich kündigt oder nicht. Um diese Vorhersage machen zu können, brauchen wir natürlich erst einmal 0:44 Daten. Wir wissen, wie oft ein Kunde Netflix nutzt. Wir wissen, ob die Nutzung in den letzten Wochen abgenommen hat und wir wissen, ob es 0:51 Supportanfragen gab. Außerdem wissen wir, ob der Kunde gekündigt hat oder nicht. Mit diesen Daten möchten wir nun vorhersagen, ob ein Kunde wahrscheinlich 1:01 kündigt oder nicht. Um einfach zu starten, verwenden wir zunächst nur eine einzige Variable. Hat die Nutzung in der letzten Woche abgenommen. Also, wir 1:10 wollen wissen, ob die variable Nutzung abgenommen uns Information gibt, ob ein Kunde erkündigen wird oder nicht. Dafür bauen wir uns einen kleinen 1:20 Entscheidungsbaum. Ganz oben steht die Frage: Nutzung abgenommen und der Baum teilt nun die Kunden in zwei Gruppen auf. In der einen Gruppe sind alle 1:29 Kunden, bei denen die Nutzung abgenommen hat. In der anderen Gruppe sind alle Kunden, bei denen die Nutzung abgenommen hat. Jetzt schauen wir uns für jede 1:37 Gruppe an, wie viele Kunden haben tatsächlich gekündigt und wie viele Kunden sind geblieben. Z.B. in der Gruppe Nutzung abgenommen. Ja, haben 1:46 vier Personen gekündigt und zwei Personen bleiben. Nun können wir prüfen, ob diese Aufteilung für die Vorhersage hilfreich ist. Aber wie machen wir das? 1:56 Schauen wir zuerst auf die Ausgangsdaten. Im gesamten Datensatz haben vier Kunden gekündigt und vier Kunden sind geblieben. Ohne weitere 2:04 Information wäre unsere Einschätzung also ungefähr 50y. Jetzt teilen wir die Kunden aber nach der variablen Nutzung abgenommen auf. in der Gruppe Nutzung 2:14 abgenommen, ja, haben vier von sechs Kunden gekündigt. Das entspricht ungefähr 67%. In der Gruppe Nutzung abgenommene, nein, 2:24 hat dagegen kein Kunde gekündigt. Also die Kündigungswahrscheinlichkeit liegt dort bei 0%. Natürlich ist das nur ein sehr kleiner Beispieldatensatz, aber man 2:33 sieht bereits die Grundidee. Durch die Aufteilung entstehen Gruppen, in denen sich die Kunden hoffentlich deutlicher unterscheiden und dadurch können wir 2:41 eine bessere Vorhersage machen, als nur mit dem Gesamtdurchschnitt. Genau dasselbe können wir nun auch für Supportanfrage machen. Also, wir teilen 2:49 die Nutzer auf in eine Gruppe, die Supportanfragen gemacht hat und eine, die keine gemacht hat. Und natürlich geht das auch für die letzte Variable. 2:57 Stunden pro Woche. Stunden pro Woche ist nun aber eine metrische Variable. Wir haben also keine Kategorien, sondern Zahlenwerte. Bei metrischen Variablen 3:07 sucht der Entscheidungsbaum deshalb nach einem passenden Grenzwert. Die Grenze könnte z.B. sein weniger oder gleich 4 Stunden. Also, es wird geschaut, welche 3:17 Kunden weniger oder gleich 4 Stunden streamen und welche mehr. Jetzt ist natürlich die Frage, welchen Grenzwert man nimmt. Man könnte auch 5 Stunden als 3:25 Grenzwert nehmen. Hier wird einfach getestet, welcher Grenzwert die Kunden am besten aufteilt. Okay, jetzt haben wir drei einzelne sehr einfache 3:34 Entscheidungsbäume erstellt. Wir wollten aber nicht drei einzelne haben, sondern einen großen. Aber wie machen wir das? Schauen wir uns das in Numiko an. Wir 3:44 verwenden einfach das gleiche Beispiel, aber mit etwas mehr Daten. Den Beispieldatensatz kannst du über den Link in der Videobeschreibung 3:51 herunterladen. Wir klicken auf Predictive Analytics. Dann wählen wir kündigt als abhängige Variable aus. Das ist also die Variable, die wir 3:59 vorhersagen möchten. Die anderen drei Variablen wählen wir als unabhängige Variable aus. Diese Variablen sollen also für die Vorhersage verwendet 4:07 werden. Nun sehen wir hier den vollständigen Entscheidungsbaum. Der Algorithmus startet mit der Variable Nutzung abgenommen. Das bedeutet, diese 4:16 Variable liefert in diesem Datensatz die beste erste Aufteilung. Der Baum trennt die Kunden also zuerst in zwei Gruppen. Kunden, bei denen die Nutzung abgenommen 4:27 hat und Kunden, bei denen die Nutzung abgenommen hat. Danach geht der Baum in jeder Gruppe weiter. In der Gruppenutzung abgenommen ja wird als 4:36 nächstes nach der Supportanfrage aufgeteilt, da Supportanfrage in dieser Gruppe die beste nächste Aufteilung liefert. Auf der anderen Seite wird sich 4:45 Stunden pro Woche angeschaut. Der Baum arbeitet sich also Schritt für Schritt nach unten. An jeder Verzweigung wird eine einfache Frage gestellt und am Ende 4:54 jedes Fades steht eine Vorhersage. Z.B. Wenn die Nutzung nicht abgenommen hat und der Kunde mehr als 4,5 Stunden streamt, lautet die Vorhersage nein. 5:05 Also, der Kunde kündigt nicht. So entsteht aus mehreren einfachen Regeln ein vollständiger Entscheidungsbaum. Und hier sieht man dann auch sehr gut, warum 5:14 Entscheidungsbäume im Vergleich zu vielen anderen Predictive Analytics Methoden sehr beliebt sind. Ein Entscheidungsbaum liefert vielleicht 5:21 nicht immer die beste Vorhersage, aber er hat einen großen Vorteil. Man kann die Entscheidungen Schritt für Schritt nachvollziehen. Wir sehen also, welche 5:29 Variable zuerst verwendet wird. Wir sehen, welche Regeln danach kommen und wir sehen, warum ein bestimmter Kunde am Ende als kündigt wahrscheinlich oder 5:38 bleibt wahrscheinlich eingestuft wird. Jetzt ist natürlich der Hauptgrund, warum wir das Modell überhaupt erstellen, damit wir Vorhersagen für 5:44 neue Daten machen können. Dafür klicken wir hier. Nun können wir in diese Tabelle die Werte eintragen, für die wir eine Vorhersage machen möchten. Z.B. 5 5:54 Stunden pro Woche, Nutzung abgenommene Nein. Und Supportanfrage ja und unsere Vorhersage ist nein. Also der Kunden gekündigt nicht. Natürlich können wir 6:05 mit Copy und Paste auch gleich mehrere Reihen reinkopieren. In der Regel möchte man sein Modell vorher aber erst einmal testen, wie gut es ist. Dafür kannst du 6:14 hier klicken und nun kannst du Daten hier reinkopieren, von denen du weißt, ob eine Person gekündigt hat oder nicht. Dies sollten aber andere Daten sein, als 6:22 du fürs Training verwendet hast. So sehen wir, wie gut das Modell bei neuen oder bisher unbekannten Daten funktioniert. Okay, nun haben wir 6:30 einiges über den Entscheidungsbaum gelernt, aber was ist nun genau Random Forest oder Gradient Boosting? Das schauen wir uns in den nächsten Videos 6:38 an. Bis bald. Ciao.