#5 Unüberwachtes Lernen I So lernen Maschinen Plattform Lernende Systeme https://www.youtube.com/watch?v=P2Qwc63iCVQ Transkript (automatisch erstellt) 0:00 [Musik] in den bisherigen videos haben wir uns dem überwachten lernen gewidmet und jetzt wollen wir uns das um überwachte 0:21 lernen anschauen ich glaube man hört auf folgendes hey wir haben hier diese ganzen daten könnt ihr da nicht was mit maschinellem lernen 0:29 machen könnt ihr nicht muster erkennen und das passiert in der praxis eigentlich nicht was man viel macht ist überwachtes lernen eben weil das 0:38 zuverlässiges denn beim überwachten lernen habe ich ja sorgfältig diese daten mit labels gesammelt die dann dem algorithmus für jeden daten punktgenau 0:48 sagen zu welchen merkmalen zu welchen features welches label gehört und da kann ich relativ zuverlässig einen algorithmus darauf trainieren und was 0:57 auch wichtig ist am ende gucken ob er funktioniert und jetzt kommt aus und überwachte lernen und sagt das brauche ich alles 1:03 nicht ich brauche keine labels gibt mir die daten so wie sie sind so leicht ist es leider nicht also überwachtes lernen ist recht schwer 1:11 eben weil man diese labels nicht hat ist nicht ganz klar was der algorithmus eigentlich lernen soll im überwachten lernen ist es deswegen essenziell dass 1:20 man alles was man an vorwissen hat darüber wie die daten entstanden sind darüber was man gerne finden möchte also was man jetzt meint mit muss dann erst 1:29 mal dieses vorwissen explizit macht und in das design des algorithmus mit einbezieht nur dann kann ein überwachtes lernen 1:36 funktionieren vielleicht machen wir dieses ganze gerede von vorwissen muster kennen mal an einem konkreten beispiel ein bisschen klarer und zwar ist nämlich 1:46 eine beliebte möglichkeit wie man muster erkennen kann so genannte clustering und clustering ist eine der populärsten methoden des unbewachten lernens und was 1:55 klasse eigentlich sind und wieso man dafür vorwissen braucht schauen wir uns jetzt einfach mal genau wir haben ein beispiel und zwar haben 2:02 uns einen online versandhändler ausgedacht der von einer betrugsfälle geplagt wird betrügerische ein käufer kaufen für hohe summen waren ein und 2:12 bestellen auf rechnung bezahlen aber die rechnung nicht das macht den online versandhändler armen und traurig und die betrüger reich und glücklich und der 2:21 online-versandhändler möchte das unterbinden was ja nämlich möchte es möglichst automatisch diese betrüger zu erkennen und ihnen das zahlen auf 2:29 rechnungen verweigern er möchte nicht allen kunden das zahlen auf rechnung verweigern denn das zahlen auf rechnung ist beliebt und das würde 2:37 seine plattform unbeliebt machen und er hat schon eine idee wie sich die betrüger von den ehrlichen kunden unterscheiden genau er vermutet nämlich 2:45 dass sich die beiden gruppen in zwei dingen unterscheiden einmal in der verweildauer auf der webseite und einmal in der summe des 2:53 warenkorbes man könnte ja vermuten dass betrüger sehr viel einkaufen also hauptsache viele waren sehr hoher warenwert und dass sie andererseits aber 3:01 auch gar nicht so lange darüber nachdenken was sie jetzt eigentlich kaufen hauptsache schnell bestellt und schnell 3:07 viel wert angekauft und glücklicherweise kann der online versandhändler diese daten in den aufzeichnungen seiner web seite nachschauen das heißt er kann zu 3:14 jedem kunden nachschauen wie lange war dieser kunden auf seiner webseite und welchen wert hat der warenkorb des kunden 3:21 diese daten kann der online versandhändler jetzt erstmal grafisch darstellen und wenn er diese daten grafisch 3:27 dargestellt hat stellt er fest dass es hier vier gruppen zu geben scheint und diese vier gruppen sind unsere klasse also diese vier punkte wolken sind die 3:36 cluster und jetzt können wir unser vorwissen benutzen das heißt wir hatten ja das vorwissen dass wir glauben dass betrüger einen sehr hohen oder für einen 3:46 sehr hohen wahren wert einkaufen und auch nur eine sehr kurze zeit auf der webseite verbringen und dies entspricht diesem cluster hier oben links das heißt 3:55 unser online versandhändler ich kann jetzt genau diese informationen ausnutzen wenn er feststellen möchte ob sich ein neuer kunde voraussichtlich als 4:03 betrüger entpuppt oder eben nicht und ein algorithmus der dieses automatische finden der cluster für uns macht serie chemnitz bei kamins fährt jeder cluster 4:14 nur noch durch einen einzigen mittelpunkt beschrieben und wenn jetzt ein neuer daten punkt reinkommt dann wird der dem cluster zugeordnet dessen 4:22 mittelpunkt er am nächsten ist in unserem beispiel hatten wir jetzt glücklicherweise daten wo kamins super funktioniert in der praxis ist das 4:31 selten der fall also da haben wir vielleicht viel mehr features und es ist überhaupt schwere auch die daten darzustellen 4:38 oder die cluster sind nicht so einfach voneinander getrennt sich überlappen ein bisschen oder oder oder und um überwachtes lernen ist 4:48 tatsächlich oft wie das überwachte lernen auch mit aufwand und arbeit verbunden es gibt nichts umsonst wir müssen alles 4:56 was wir wissen haben darüber wie die daten entstanden sind und darüber was wir finden wollen mit in unseren algorithmus integrieren mehr noch 5:04 vielleicht als wir es hier im beispiel gemacht haben damit unüberwacht das lernen gute ergebnisse liefert [Musik]