Das Video kommt von YouTube: erst beim Abspielen verbindet sich die Seite mit YouTube (Google).
Entscheidungsbaum einfach erklärt – Predictive Analytics mit Beispiel
Das Wichtigste aus dem Video
Tipp auf eine Zeit – das Video springt genau dorthin.
Transkriptautomatisch erstellt · 46 Zeilen
- In diesem Video geht es um den Entscheidungsbaum. Also, was ist ein Entscheidungsbaum? Die Grundidee ist einfach, ein
- Entscheidungsbaum soll uns helfen mit Hilfe von vorhandenen Daten eine Vorhersage für neue Daten zu machen. Also einfach gesagt, wir haben
- vorhandene Daten, mit deren Hilfe wir einen Entscheidungsbaum erstellen. Diesen Entscheidungsbaum können wir dann verwenden, um für neue Daten eine
- Vorhersage zu machen. Aber wie geht das? Wie wird der Entscheidungsbaum erstellt? Schauen wir uns das an einem Beispiel an. Sagen wir, du arbeitest bei Netflix
- und du möchtest wissen, ob ein Kunde wahrscheinlich kündigt oder nicht. Um diese Vorhersage machen zu können, brauchen wir natürlich erst einmal
- Daten. Wir wissen, wie oft ein Kunde Netflix nutzt. Wir wissen, ob die Nutzung in den letzten Wochen abgenommen hat und wir wissen, ob es
- Supportanfragen gab. Außerdem wissen wir, ob der Kunde gekündigt hat oder nicht. Mit diesen Daten möchten wir nun vorhersagen, ob ein Kunde wahrscheinlich
- kündigt oder nicht. Um einfach zu starten, verwenden wir zunächst nur eine einzige Variable. Hat die Nutzung in der letzten Woche abgenommen. Also, wir
- wollen wissen, ob die variable Nutzung abgenommen uns Information gibt, ob ein Kunde erkündigen wird oder nicht. Dafür bauen wir uns einen kleinen
- Entscheidungsbaum. Ganz oben steht die Frage: Nutzung abgenommen und der Baum teilt nun die Kunden in zwei Gruppen auf. In der einen Gruppe sind alle
- Kunden, bei denen die Nutzung abgenommen hat. In der anderen Gruppe sind alle Kunden, bei denen die Nutzung abgenommen hat. Jetzt schauen wir uns für jede
- Gruppe an, wie viele Kunden haben tatsächlich gekündigt und wie viele Kunden sind geblieben. Z.B. in der Gruppe Nutzung abgenommen. Ja, haben
- vier Personen gekündigt und zwei Personen bleiben. Nun können wir prüfen, ob diese Aufteilung für die Vorhersage hilfreich ist. Aber wie machen wir das?
- Schauen wir zuerst auf die Ausgangsdaten. Im gesamten Datensatz haben vier Kunden gekündigt und vier Kunden sind geblieben. Ohne weitere
- Information wäre unsere Einschätzung also ungefähr 50y. Jetzt teilen wir die Kunden aber nach der variablen Nutzung abgenommen auf. in der Gruppe Nutzung
- abgenommen, ja, haben vier von sechs Kunden gekündigt. Das entspricht ungefähr 67%. In der Gruppe Nutzung abgenommene, nein,
- hat dagegen kein Kunde gekündigt. Also die Kündigungswahrscheinlichkeit liegt dort bei 0%. Natürlich ist das nur ein sehr kleiner Beispieldatensatz, aber man
- sieht bereits die Grundidee. Durch die Aufteilung entstehen Gruppen, in denen sich die Kunden hoffentlich deutlicher unterscheiden und dadurch können wir
- eine bessere Vorhersage machen, als nur mit dem Gesamtdurchschnitt. Genau dasselbe können wir nun auch für Supportanfrage machen. Also, wir teilen
- die Nutzer auf in eine Gruppe, die Supportanfragen gemacht hat und eine, die keine gemacht hat. Und natürlich geht das auch für die letzte Variable.
- Stunden pro Woche. Stunden pro Woche ist nun aber eine metrische Variable. Wir haben also keine Kategorien, sondern Zahlenwerte. Bei metrischen Variablen
- sucht der Entscheidungsbaum deshalb nach einem passenden Grenzwert. Die Grenze könnte z.B. sein weniger oder gleich 4 Stunden. Also, es wird geschaut, welche
- Kunden weniger oder gleich 4 Stunden streamen und welche mehr. Jetzt ist natürlich die Frage, welchen Grenzwert man nimmt. Man könnte auch 5 Stunden als
- Grenzwert nehmen. Hier wird einfach getestet, welcher Grenzwert die Kunden am besten aufteilt. Okay, jetzt haben wir drei einzelne sehr einfache
- Entscheidungsbäume erstellt. Wir wollten aber nicht drei einzelne haben, sondern einen großen. Aber wie machen wir das? Schauen wir uns das in Numiko an. Wir
- verwenden einfach das gleiche Beispiel, aber mit etwas mehr Daten. Den Beispieldatensatz kannst du über den Link in der Videobeschreibung
- herunterladen. Wir klicken auf Predictive Analytics. Dann wählen wir kündigt als abhängige Variable aus. Das ist also die Variable, die wir
- vorhersagen möchten. Die anderen drei Variablen wählen wir als unabhängige Variable aus. Diese Variablen sollen also für die Vorhersage verwendet
- werden. Nun sehen wir hier den vollständigen Entscheidungsbaum. Der Algorithmus startet mit der Variable Nutzung abgenommen. Das bedeutet, diese
- Variable liefert in diesem Datensatz die beste erste Aufteilung. Der Baum trennt die Kunden also zuerst in zwei Gruppen. Kunden, bei denen die Nutzung abgenommen
- hat und Kunden, bei denen die Nutzung abgenommen hat. Danach geht der Baum in jeder Gruppe weiter. In der Gruppenutzung abgenommen ja wird als
- nächstes nach der Supportanfrage aufgeteilt, da Supportanfrage in dieser Gruppe die beste nächste Aufteilung liefert. Auf der anderen Seite wird sich
- Stunden pro Woche angeschaut. Der Baum arbeitet sich also Schritt für Schritt nach unten. An jeder Verzweigung wird eine einfache Frage gestellt und am Ende
- jedes Fades steht eine Vorhersage. Z.B. Wenn die Nutzung nicht abgenommen hat und der Kunde mehr als 4,5 Stunden streamt, lautet die Vorhersage nein.
- Also, der Kunde kündigt nicht. So entsteht aus mehreren einfachen Regeln ein vollständiger Entscheidungsbaum. Und hier sieht man dann auch sehr gut, warum
- Entscheidungsbäume im Vergleich zu vielen anderen Predictive Analytics Methoden sehr beliebt sind. Ein Entscheidungsbaum liefert vielleicht
- nicht immer die beste Vorhersage, aber er hat einen großen Vorteil. Man kann die Entscheidungen Schritt für Schritt nachvollziehen. Wir sehen also, welche
- Variable zuerst verwendet wird. Wir sehen, welche Regeln danach kommen und wir sehen, warum ein bestimmter Kunde am Ende als kündigt wahrscheinlich oder
- bleibt wahrscheinlich eingestuft wird. Jetzt ist natürlich der Hauptgrund, warum wir das Modell überhaupt erstellen, damit wir Vorhersagen für
- neue Daten machen können. Dafür klicken wir hier. Nun können wir in diese Tabelle die Werte eintragen, für die wir eine Vorhersage machen möchten. Z.B. 5
- Stunden pro Woche, Nutzung abgenommene Nein. Und Supportanfrage ja und unsere Vorhersage ist nein. Also der Kunden gekündigt nicht. Natürlich können wir
- mit Copy und Paste auch gleich mehrere Reihen reinkopieren. In der Regel möchte man sein Modell vorher aber erst einmal testen, wie gut es ist. Dafür kannst du
- hier klicken und nun kannst du Daten hier reinkopieren, von denen du weißt, ob eine Person gekündigt hat oder nicht. Dies sollten aber andere Daten sein, als
- du fürs Training verwendet hast. So sehen wir, wie gut das Modell bei neuen oder bisher unbekannten Daten funktioniert. Okay, nun haben wir
- einiges über den Entscheidungsbaum gelernt, aber was ist nun genau Random Forest oder Gradient Boosting? Das schauen wir uns in den nächsten Videos
- an. Bis bald. Ciao.
Zum Nachlesen
EntscheidungsbaumEntscheidungsbäume (englisch: decision tree) sind geordnete, gerichtete Bäume, die der Darstellung von Entscheidungsregeln dienen. Die grafische Darstellung …
Erweiterte IntelligenzDiese Art der Verarbeitung wird auch unüberwachtes Lernen genannt, da die Algorithmen selbstständig Zusammenhänge in den Datensätzen erkennen und darstellen.
Random ForestRandom Forest (deutsch Zufallswald) oder Random Decision Forest ist ein Verfahren, das beim maschinellen Lernen eingesetzt wird. Es handelt sich um eine …