Neuronale Netze [013] - Delta-Lernregel und MNIST - One Hot Encoding - Theorie Brotcrunsher https://www.youtube.com/watch?v=Bg-TY_Qrpvw Transkript (automatisch erstellt) 0:00 halli hallo eine weitere episode mannes neuronalen netze tutorials in dieser episode werden wir beginnen die delta lernen regel im zusammenhang mit den 0:08 mist datensatz zu analysieren das heißt wir werden also mit hilfe der der der delta lernen regel den mist datensatz lernen und dann gucken okay wie gut 0:19 eignet sich das dafür eigentlich in dieser episode schauen wir uns den netzaufbau an und in der nächsten episode werden wir das ganze dann 0:27 implementieren und eben auch evaluieren was dabei dann am ende eigentlich rauskommt so zunächst mal zunächst ein netzaufbau hier haben wir die inputs die 0:38 inputs sind relativ simpel dass daneben 28 mal 28 stück also 784 stück an im putz das sind die einzelnen pixel daten das sind zwar viele aber es ist nicht 0:50 wirklich schwer wir brauchen dafür auch kein bayers oder sonst irgendwas alles was wir brauchen ist sind diese pixel daten ja die haben wir hier drin 0:59 wir müssten theoretisch nicht mal geordnet sein könnte dass neuronale netz genauso gut damit umgehen also weder schlechter noch besser wenn die 1:06 ungeordnet bären hauptsache ist nur dass zwischen den unterschiedlichen tests jeder einzelne von diesen input neuronen den gleichen pixel sozusagen übernimmt 1:16 so okay das ist es soweit zu dem input jetzt kommen wir zum output und jetzt zunächst mal eine triviale herangehensweise an das ganze und zwar 1:27 könnte man sich jetzt überlegen okay wir haben einfach einen output das ist ein neuron und dieses neuron soll eine zahl zwischen null und neun dann ausgeben 1:37 das ganze ist aber falsch warum ist das ganze so falsch in dieser diesem netzaufbau das würde bedeuten dass die zahlen 2 und 3 näher 1:50 beieinander liegen als zb 2 und 7 klar auf dem zahlen strahl ist es so aber wenn er jetzt mal einfach nur die grafische repräsentation einer zahl 2:00 anguckt dann liegt vermutlich die zwei und die sieben sogar näher beieinander als die zwei und drei ja wenn ihr einfach nur zahlen zwischen 0 und 9 in 2:11 einem solchen euro hier ausgeben würde ja wie gesagt dann wäre die distanz zwischen diesen beiden bildern kleiner je näher der zahlenwert 2:21 beieinander liegt aber das ist nicht das was wir wollen deswegen machen wir eine andere strategie und zwar heißt dass sowohl hot 2:28 encoding und zwar machen wir dann nicht einen output sondern so viele outputs wir unterschiedliche labels haben also in unserem fall zehn stück das sind also 2:40 diese zehn output neuronen und der soll aus put ist dann von dem neuron welches tatsächlich die zahl ist ist 1 und von anderen von allen anderen ist 0 2:52 ja das ist also der sollwert der daten am ende herauskommt und auf die art und weise liegen dann alle bilder zunächst mal gleich weit voneinander weg so also 3:05 beim training ist es so dass das was tatsächlich richtig ist dass es 1 und alle anderen sind 0 aber wenn wir das dann anwenden dann 3:13 haben wir irgendwelche zahlen werde natürlich zwischen 0 und 1 als output und das ist unheimlich nützlich denn das können wir benutzen als sozusagen die 3:23 sicherheit von unserem netz also wie sicher ist sich dieses netz das jetzt diese zahl tatsächlich eine 3 ist oder nicht wird der zahlenwert höher 3:32 dann ist er sich sicherer ist niedriger ist es sich unsicherer und wir haben sogar auch noch einen platz zwei also ich bin mir relativ sicher dass es eine 3:40 2 ist aber es könnte auch das und das seien ja also wir haben eine hierarchie von allen zahlen zueinander was am wahrscheinlichsten von unserem 3:50 neuronalen netze entsprechend eingestuft wird ok worauf können wir bei diesem test eigentlich hoffen 3:57 das netz ist sehr simpel das muss man dazu sagen also das sind zwar viele neuronen und dementsprechend auch viele verbindungen deswegen sieht es für uns 4:07 jetzt zunächst mal komplex aus aber wir haben zum beispiel nicht mal hätten schicht da drin das heißt alles was das netz am ende des 4:14 tages eigentlich machen kann ist einzelne pixel anzugucken und zu analysieren wie wahrscheinlich ist es dass dieser pixel bei der 4:26 der zahl vorkommt was das neuronale netz nicht machen kann ist zusammenhänge zwischen unterschiedlichen pixeln herzustellen 4:33 das kann das neuronale netz nicht denn dafür bräuchten wir eine zusätzliche hinten schicht welche dann eben diese zusammen liegenden pixel irgendwie 4:42 zusammenfasst und dann auf dieser basis weiter analysiert dementsprechend werden wir auf keinen fall hier ein ergebnis erwarten können welches wir sozusagen in 4:55 der produktion tatsächlich benutzen können aber wir werden zumindest mal ein messwert haben sozusagen eine base line 5:04 auf die wir dann alle kommenden lern algorithmen darauf aufbauen können also es muss mindestens so gut sein wie die delta lernen regel und der zahlenwert 5:13 denn wir hier bekommen werden und dafür wird die sogenannte r rating brigens auch wurde ins leben gerufen sie gibt an wie viel prozent liegt 5:25 unsere unser neuronales netz falsch das heißt am anfang werden es 90 prozent seien das m10 zahlen und es wird am anfang zunächst mal nur raten können das 5:35 heißt in 90 prozent der fälle ist unser neuronales netz liegt daneben also im durchschnitt das natürlich ein bisschen ab aber im durchschnitt sind es dann 20 5:46 prozent und danach mit dem kommenden lärm durchgang wird dann entsprechend auch besser genau und das gucken wir uns in der nächsten episode an und da geht 5:58 es dann wie gesagt um die täter lernen regel und um den mist datensatz gut bis zum nächsten mal