Entscheidungsbäume Lernen mit M https://www.youtube.com/watch?v=I6169uhA_6c Transkript (automatisch erstellt) 0:00 herzlich willkommen zum Abschnitt künstliche Intelligenz heute schauen wir uns sogenannte Entscheidungsbäume an doch zu Beginn eine kurze 0:08 Begriffsdefinition wir unterscheiden ja unter anderem zwei Arten der künstlichen Intelligenz einmal sogenannte generative KI kennt man meist von den typischen 0:17 Anwendungen wie jgpt zur Erzeugung von unterschiedlichen Inhalten beispielsweise Text Code Video Bild 3D oder auf der anderen Seite gibt es noch 0:26 diskriminative KI welche anhand eines Datenbestands ationen überprüft Entscheidungen fällen lässt Unterschiede identifiziert oder klustter herausbildet 0:36 aus einer Datenmenge jetzt bei den entscheidungsbäumen sind wir bei den diskriminativen KIS wir werden bei den 0:44 entscheidungsbäumen natürlich Bäume in der Informatik verwenden diese unterscheiden sich ganz grundlegend von Bäumen z.B aus der Biologie jetzt ist es 0:52 nämlich so bei Bäumen in der Informatik gibt's Knoten und Kanten ja Knoten können noch mal differenziert werden bei den Bäumen in der Informatik ist es so 1:02 dass die Wurzel ganz oben ist ja ist der erste große Unterschied zu Bäumen in der freien Natur oder in der Biologie also der erste Knoten oben ist die Wurzel 1:11 dann Knoten die Nachfolger noch aufweisen mindestens ein sind sogenannte innere Knoten und wenn dann kein Nachfolger mehr vorhanden ist dann 1:19 spricht man von einem Blatt alle Knoten sind mit Kanten verbunden bei den entscheidungsbäumen in der Informatik ist es so dass das was 1:29 man unter such der Untersuchungsgegenstand der ist dichotom das heißt man hat zwei Möglichkeiten zur Entscheidung Ja oder Nein etwas machen 1:36 etwas nicht machen das ist die Zielgröße die ich untersuchen will z.B Radfahren ja Nein ob jemand ins Vorstellungsgespräch anhand der 1:44 Bewerbungsunterlagen eingeladen werden soll ja oder nein bzw Sport heute ja oder nein und um die Zielgröße zu ermitteln ist es noch notwendig dass man 1:52 eine Vielzahl von Kriterien festlegt welche natürlich einen inhaltlichen Einfluss auf die Zielgröße aufweisen sollen und die Zielgröße wird dann in 2:03 den Blättern festgelegt und die Kriterien entsprechen dann unseren inneren Knoten als Anwendungsbeispiel nehmen wir hier die Zielgröße hier mit 2:11 dem Fahrrad zur Schule fahren ja oder nein und als Kriterien Wind Regen und Bodenfrost exemplarisch diese Entscheidungsbäume 2:19 sind z.B im Bereich des überwachten Lernens beim maschinellen lernen denkbar wir konstruieren jetzt den Baum den Entscheidungsbaum auf Basis von 2:28 bekannten Datensätzen sind dann unsere Trainingsdaten und wir müssen uns noch drüber Gedanken machen über die Reihenfolge der Kriterien fangen wir mit 2:36 Bodenfrost an mit Wind oder mit Regen das ganze kann man inhaltlich orientiert vollziehen lassen oder man verwendet maschinelles Lernen als Hilfestellung 2:45 wir werden zweiteres machen natürlich und die Reihenfolge der Kriterien muss jetzt so gewählt werden dass die Datensätze in den Knoten möglichst gut 2:55 sortiert werden also dass die Entscheidungsfindung möglichst eindeutig ausfällt wir nehmen mal an wir hätten folgende Daten gesammelt insgesamt sechs 3:03 Datensätze mit den Eintragungen zu den Kriterien windregen Bodenfrost und zur Zielgröße Radfahren bei d0 ist es z.B so da gab es keinen Wind dafür Regen keinen 3:14 Bodenfrost und die Person ist dann Rad gefahren womit starte ich nun ja wir beginnen einfach mal mit Regen als Wurzel ja Regen Wurzel ist ganz oben 3:24 dann haben wir unten die Möglichkeiten zu sagen es gibt Regen ja Links oder es gibt Regen nein und wir gehen jetzt alle Datensätze von oben nach unten durch und 3:32 ordnen diese dann zu ob Regen stattgefunden hat oder nicht bei d n0 steht in der Tabelle Regen drin ja also ordnen wir die nach links an bei 3:41 D1 gab es keinen Regen also nach rechts wir machen dasselbe Spiel für D2 bei D2 gab es keinen Regen und wir finalisieren dann den Baum folgendermaßen ja D3 und 3:51 D4 gab es auch kein Regen bei die fün hingegen gab es wieder regen die rote und die grüne Markierung der Datenknoten oder der Datensätze zeigt darauf hin ob 4:01 die Person radgefahren ist grün oder nicht entsprechend rot wenn wir uns jetzt das erste Zwischenergebnis anschauen stellen wir fest dass die 4:09 Sortierung nicht sehr gut ist wir haben eine sehr hohe Heterogenität ja wir haben in beiden Faden also sowohl ja als auch nein haben wir 50% der Datensätze 4:17 die radgefahren sind 50% sind nicht radgefahren das hilft uns natürlich überhaupt nicht wir machen also weiter und wählen beispielsweise Bodenfrost als 4:26 Wurzel aus das Ergebnis seht ihr hier und jetzt ist ist es schon wesentlich besser ja gerade wenn wir uns auf der zweiten Seite das Anschauen haben wir 4:35 eine sehr gute Sortierung für ja wir haben überhaupt keine Heterogenität mehr weil bei Bodenfrost gleich ja haben wir nur Datensätze die nicht radgefahren 4:45 sind und wir müssen dann nur noch für alle anderen übrigen Datensätze die 0 die 1 die 3 und den 5 den Baum weiter zeichnen da die Entscheidung eindeutig 4:55 ist auf der linken Seite für botenfrost wird jetzt dieser Knoten zu ein Blatt mit einer eindeutigen Entscheidung nämlich hier nicht Radfahren und der 5:03 Baum ist in diesem linken Teil jetzt bereits abgeschlossen und wir können dann mit den weiteren Knoten die0 die1 D3 und 5:11 die5 weitermachen bevor wir das machen überlegen wir noch ein bisschen wie wir die Entscheidungen fällen wir nehmen einfach mal an dass keine 5:19 Entscheidungsfindung mehr möglich ist wir sind also in einem Blatt angelangt hier in diesem anderen Beispiel abweichenden Beispiel was wir jetzt hier 5:27 machen vorher war se ja eindeutig zwei nicht Rad fahren hier ist es so zwei würden Radfahren eine Person würde nicht Radfahren die Entscheidung fällt 2 Z ein 5:36 aus wir machen das Ganze nach der Mehrheit und würden hier also sagen Radfahren für diese Person wenn ich in einem Blatt angelangt bin und ich habe 5:42 ungefähr immer noch 5050 was die Aufteilung angeht dann muss ich kann ich eins zufällig auswählen ja da ist dann keine Entscheidung besser als die weils 5:50 andere wir machen wieder weiter aber mit dem Beispiel von vorher d 0 die 1 die 3 und die 5 sind noch übrig und ich zeichne jetzt den restlichen Baum weiter 6:00 es gilt zu überlegen auf der richten Seite auf der rechten Seite mache ich mit Regen weiter oder mache ich mit Wind weiter auch hier ich als Mensch probiere 6:08 es aus die KI macht das Ganze automatisch berechnet das jeweils Beste und zeichnet so den kompletten Baum wir als Mensch probieren einfach mal Regen 6:16 aus als Alternative ja stellen wir fest für die verbleibenden Datensätze für die0 steht drin dass es Regen gab also kommt die n0 nach links die5 gab es 6:28 auch Regen kommt nach links und die 1 und die D gab es jeweils kein Regen kommen nach rechts für Wind auf der rechten Seite in diesem rechten 6:36 Entscheidungsbaum gab es in D1 und D5 Wind und d0 und D3 kein Wind und wenn wir jetzt die beiden Bäume vergleichen stellen wir eigentlich fest dass sie 6:45 identisch sind was die Qualität angeht ja wir haben in einem Knoten eine eindeutige Entscheidungsfindung die da möglich ist und in dem jeweils anderen 6:56 Knoten des Baumes ist es noch i50y zwischen Rad fahren und nicht Radfahren also auf der jeweils rechten Seite wenn es nicht regnet und wenn kein Wind geht 7:05 dann würde ich hier automatisch Radfahren wenn man jetzt genau hinschaut würde das bedeuten wenn wir uns nur den linken Baum mal anschauen in einem Fall 7:14 wenn es keinen Bodenfrost gibt und keinen Regen gibt dann würde ich jetzt Rad fahren das mag aber der Realität widersprechen weil das Kriterium Wind 7:24 hier gar nicht mehr berücksichtigt wird und ich würde auch wenn draußen der Wind 130 kmh hätte würde ich noch Rad fahren hier sehen wir also den Unterschied 7:33 zwischen dem was man in der Realität wohl sinnvollerweise machen müsste ja also noch mal das Kriterium Wind mit 7:40 einbeziehen und dem was die KI ausgibt das Problem ist natürlich hier wir haben sehr sehr wenige Datensätze also die Anzahl der Datensätze beeinflusst auch 7:48 die Qualität der KI wie wir hier sehen da beide Möglichkeiten Regen und Winden gleich gut sind wähle ich eins davon aus ich wähle mir den Regen aus und mache 7:57 mit Regen weiter es verbleiben nur noch die Datensätze d0 und D5 ich hänge das nächste Kriterium Wind an und stelle fest Wind für die Null nein und für die 8:08 5 gleich ja und jetzt habe ich hier in meinen beiden Knoten eindeutige Entscheidungsfindung übrig für den linken Baum bei Wind gleich ja ist nur 8:18 noch eine Person drin die nicht radgefahren ist und bei nein ist es entsprechend eine die radgefahren ist und so kann ich das also ergänzen ich 8:25 bin mit meinem kompletten Entscheidungsbaum fertig ich habe überall die Blätter die Entscheidungsfindungen und jetzt kann 8:30 ich von oben von der Wurzel durchgehen und mir für alle Wetterlagen wenn ich Information zum Bodenfrost zum Regen habe und zum Wind entscheiden ob ich 8:38 radfahre oder nicht radfahre das ganze natürlich gesteuert und umgesetzt durch eine KI hier habe ich euch das heute etwas ausführlicher gezeigt in 8:48 Einzelschritten wie das ganze funktioniert wenn ihr weitere Videos sehen wollt zum Thema Informatik oder aber auch Wirtschaft und Recht dann 8:57 könnt ihr gerne auf meinem lernkanal noch noch weit Videos stöbern ich würde mich über ein Abo freuen ich hoffe das Lernvideo hat euch einiges an 9:04 Informationen gebracht würde mich freuen Euch bald wieder auf dem Kanal zu sehen servus und ciao