Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Künstliches Neuron

Ein künstliches Neuron bildet die Basis für das Modell der künstlichen neuronalen Netze, ein Modell aus der Neuroinformatik, das durch biologische neuronale …

Inhalt6 Abschnitte
  1. 1. Grundidee und Bedeutung
  2. 2. Biologisches Vorbild
  3. 3. Aufbau und mathematische Beschreibung
  4. 4. Aktivierungsfunktionen
  5. 5. Boolesche Funktionen und Lernen
  6. 6. Leistung eines einzelnen Neurons

Grundidee und Bedeutung

Ein künstliches Neuron ist ein Grundbaustein künstlicher neuronaler Netze. Es ist ein Modell aus der Neuroinformatik und wurde durch biologische Nervenzellen motiviert. In einem Netzwerk aus vielen künstlichen Neuronen können solche Systeme komplexe Funktionen approximieren, Aufgaben erlernen und Probleme lösen, die sich nur schwer ausdrücklich modellieren lassen. Als Beispiele nennt der Artikel Gesichts- und Spracherkennung.

Ein künstliches Neuron verarbeitet mehrere Eingaben. Diese Eingaben werden gewichtet, also je nach Verbindung unterschiedlich stark berücksichtigt. Danach werden sie an eine Ausgabefunktion beziehungsweise Aktivierungsfunktion übergeben, die die Aktivierung des Neurons berechnet. Das Verhalten eines Neurons wird meist nicht fest vorgegeben, sondern durch Einlernen mit einem Lernverfahren erzeugt.

Die frühe Entwicklung begann 1943 mit Warren McCulloch und Walter Pitts. Ihre McCulloch-Pitts-Zelle zeigte an einem vereinfachten Modell eines neuronalen Netzes, dass logische und arithmetische Funktionen berechnet werden können. 1949 beschrieb Donald Hebb die Hebbsche Lernregel: Wiederholt aktive Verbindungen zwischen Nervenzellen werden gestärkt. 1958 zeigte Frank Rosenblatt mit dem Konvergenztheorem über das Perzeptron, dass dieses Modell mit dem angegebenen Lernverfahren alle repräsentierbaren Lösungen einlernen kann. 1969 zeigten Marvin Minsky und Seymour Papert eine Grenze einstufiger Perzeptronen: Eine XOR-Verknüpfung kann nicht dargestellt werden, weil sie nicht linear separierbar ist. Später trugen unter anderem Hopfield-Netze ab 1985 und das Backpropagation-Verfahren von David E. Rumelhart, Geoffrey E. Hinton und Ronald J. Williams ab 1986 zur Wiederbelebung der Forschung bei.

Biologisches Vorbild

Künstliche Neuronen orientieren sich an Nervenzellen von Säugetieren. Nervenzellen nehmen Signale auf, verarbeiten sie und leiten sie über Synapsen elektrisch oder chemisch an andere Nervenzellen oder Effektorzellen weiter. Eine biologische Nervenzelle besteht aus Zellkörper, Axon und Dendriten. Dendriten nehmen Signale auf, das Axon dient als Signalausgang und kann bis zu 1 m lang sein. Synapsen können erregend oder hemmend wirken.

Die Dendriten leiten elektrische Erregungen zum Zellkörper. Wenn die Erregung einen Grenzwert erreicht und überschreitet, entlädt sich die Spannung und breitet sich über das Axon aus. Dieses Prinzip heißt Alles-oder-nichts-Gesetz. Die Verschaltung sehr vieler Nervenzellen bildet eine Grundlage der geistigen Leistung des Gehirns.

Das menschliche Zentralnervensystem besteht nach Schätzungen aus 10^{10} bis 10^{12} Nervenzellen. Diese besitzen durchschnittlich 10.000 Verbindungen, sodass das menschliche Gehirn mehr als 10^{14} Verbindungen besitzen kann. Ein Aktionspotential im Axon kann sich mit bis zu 100 m/s fortpflanzen.

Der Artikel betont auch den Unterschied zu technischen Logikgattern: Gatter schalten im Nanosekunden-Bereich (10^{−9}) und verbrauchen nach Daten von 1991 etwa 10^{−6} Joule, während Nervenzellen im Millisekunden-Bereich (10^{−3}) reagieren und nur etwa 10^{−16} Joule verbrauchen. Trotz langsamerer Einzelschritte erreichen biologische Systeme Leistungen, an die rechnergestützte Systeme nicht heranreichen. Ein Beispiel ist die 100-Schritt-Regel: Visuelle Erkennung beim Menschen findet in maximal 100 sequentiellen Verarbeitungsschritten statt.

Aufbau und mathematische Beschreibung

Bei der Modellierung wird das biologische Vorbild stark vereinfacht, damit es in der Informationstechnik verwendbar ist. Die Synapsen einer Nervenzelle werden durch die Addition gewichteter Eingaben dargestellt. Die Aktivierung des Zellkerns wird durch eine Aktivierungsfunktion mit Schwellenwert modelliert. Diese Idee mit Addierer und Schwellenwert findet sich schon in der McCulloch-Pitts-Zelle von 1943.

Ein künstliches Neuron mit Index j und n Eingängen mit Index i hat vier Basiselemente: Gewichtung, Übertragungsfunktion, Aktivierungsfunktion und Schwellenwert. Die Gewichte w_{ij} bestimmen, wie stark eine Eingabe i auf ein Neuron j wirkt. Je nach Vorzeichen kann eine Eingabe hemmend (inhibitorisch) oder erregend (exzitatorisch) sein. Ein Gewicht von 0 bedeutet, dass keine Verbindung zwischen zwei Knoten besteht.

Die Übertragungsfunktion Σ berechnet aus den gewichteten Eingaben die Netzeingabe des Neurons. Die Aktivierungsfunktion φ bestimmt daraus die Ausgabe. Der Schwellenwert θ_j verschiebt die gewichteten Eingaben. Bei einer Schwellenwertfunktion wird das Neuron aktiviert, wenn der Schwellenwert überschritten ist. Mathematisch verschiebt der Schwellenwert die Trennebene im Merkmalsraum.

Die Eingaben x_i können aus einem beobachteten Prozess stammen oder Ausgaben anderer Neuronen sein. Das Ergebnis der Aktivierungsfunktion heißt Aktivierung oder Ausgabe o_j, wobei o für „output“ steht.

Mathematisch wird die Aktivierung v, auch Netzeingabe oder „net“ genannt, oft so definiert: v = \sum_{i=1}^{n} x_i w_i + w_0. Als Vereinfachung führt man eine synthetische Eingabe x_0 = 1 ein und schreibt: v = \sum_{i=0}^{n} x_i w_i. Die Ausgabe ist o = φ(v). Dabei ist n die Anzahl der Eingaben, x_i die Eingabe mit Index i, w_i ihre Gewichtung, φ die Aktivierungsfunktion und o die Ausgabe.

Aktivierungsfunktionen

Die Aktivierungsfunktion φ legt fest, wie aus der Netzeingabe die Ausgabe des Neurons entsteht. Je nach Netztopologie können verschiedene Funktionstypen verwendet werden. Sie können nicht-linear sein, zum Beispiel sigmoid, stückweise linear oder eine Sprungfunktion. Im Allgemeinen sind Aktivierungsfunktionen monoton steigend.

Lineare Aktivierungsfunktionen sind stark eingeschränkt. Eine Zusammensetzung linearer Funktionen kann durch Umformung wieder als eine einzige lineare Funktion dargestellt werden. Deshalb sind sie für mehrschichtige Verbindungsnetzwerke nicht geeignet und werden nur in einfachen Modellen verwendet.

Die Schwellenwertfunktion, englisch hard limit, nimmt nur die Werte 0 oder 1 an: φ^{hlim}(v) = 1, wenn v ≥ 0, und φ^{hlim}(v) = 0, wenn v < 0. Bei subtraktiver Verwendung eines Schwellenwerts θ wird die Funktion nur aktiviert, wenn die zusätzliche Eingabe den Schwellenwert übersteigt. Ein Neuron mit dieser Funktion heißt auch McCulloch-Pitts-Zelle und spiegelt die Alles-oder-nichts-Eigenschaft wider.

Die stückweise lineare Funktion bildet ein begrenztes Intervall linear ab und die äußeren Intervalle auf konstante Werte: φ^{pwl}(v) = 1, wenn v ≥ 1/2; φ^{pwl}(v) = v + 1/2, wenn −1/2 < v < 1/2; und φ^{pwl}(v) = 0, wenn v ≤ −1/2.

Sigmoide Funktionen werden häufig als Aktivierungsfunktionen verwendet. Sie besitzen ein variables Steigungsmaß a, das die Krümmung des Funktionsgraphen beeinflusst. Wichtig ist ihre Differenzierbarkeit, die Verfahren wie den Backpropagation-Algorithmus ermöglicht. Die angegebene Form lautet: φ_a^{sig}(v) = 1 / (1 + exp(−av)). Die Werte dieser Funktionen liegen im Intervall [0,1]; für das Intervall [−1,+1] lassen sie sich entsprechend definieren.

Die Rectifier-Funktion, auch ReLU, wird besonders in Deep-Learning-Modellen erfolgreich eingesetzt. Sie ist als Positivteil ihres Arguments definiert: φ(v) = max(0,v).

Boolesche Funktionen und Lernen

Mit künstlichen Neuronen lassen sich boolesche Funktionen darstellen, zum Beispiel Konjunktion (and), Disjunktion (or) und Negation (not). Dafür kann eine Schwellenwertfunktion φ^{hlim} verwendet werden. Bei der Konjunktion ergibt sich nur für x_1 = 1 und x_2 = 1 die Ausgabe 1. Im Artikel wird dies mit Gewichten w_1 = 1,0 und w_2 = 1,0 sowie dem Schwellenwert θ = 1,5 gezeigt: o = φ^{hlim}((1,0 · 1 + 1,0 · 1) − 1,5) = φ^{hlim}(0,5) = 1. In den anderen Fällen ist die Ausgabe 0.

Ein Neuron kann solche Gewichtungen auch erlernen. Dazu werden Gewichte und Schwellenwert zunächst zufällig gewählt und anschließend mit einem Lernalgorithmus nach dem Prinzip „Versuch und Irrtum“ angepasst. Für die logische Konjunktion wird im Artikel die Perzeptron-Kriteriumsfunktion verwendet. Sie addiert fehlerhaft erkannte Eingaben auf die Gewichtung, bis möglichst alle Eingaben richtig klassifiziert werden. Die Lernrate wird mit α = 1 gewählt.

Statt den Schwellenwert direkt anzugeben, kann ein Bias beziehungsweise on-Neuron verwendet werden: ein konstanter Eingang x_0 = 1. Der Schwellenwert wird dann über w_0 = −θ dargestellt. Für das Lernen werden Eingaben, die zur Ausgabe 0 gehören, mit −1 multipliziert. Anfangs werden beispielhaft die Gewichte w_0 = 0,1, w_1 = 0,6 und w_2 = −0,3 gewählt.

Die Korrektur der Gewichte erfolgt mit der Formel w_i^{neu} = w_i^{alt} + \sum_j α · (t_j − o_j) · x_i. Dabei ist j die Nummer der Eingabe, t_j die gewünschte Ausgabe, o_j die tatsächliche Ausgabe, x_i die Eingabe des Neurons und α > 0 der Lerngeschwindigkeits-Koeffizient. Nach zwei Anpassungsschritten erhält das Beispiel Gewichte, mit denen das Neuron die Konjunktion richtig berechnet: w_0 = −0,9, w_1 = 0,6 und w_2 = 0,7. Für x_1 = 1 und x_2 = 1 folgt o = φ^{hlim}((0,6 · 1 + 0,7 · 1) − 0,9) = φ^{hlim}(0,4) = 1; für x_1 = 0 und x_2 = 1 folgt o = φ^{hlim}((0,6 · 0 + 0,7 · 1) − 0,9) = φ^{hlim}(−0,2) = 0.

Leistung eines einzelnen Neurons

Ein einzelnes künstliches Neuron kann auch ohne ein ganzes Netzwerk maschinell lernen. In statistischer Sprache geht es dabei um lineare Regression und Klassifizierung. Es kann lineare Funktionen erlernen und linear trennbare Klassen unterscheiden.

Mit dem sogenannten Kerneltrick können auch nichtlineare Modelle gelernt werden. Dadurch kann ein einzelnes Neuron ähnliche Ergebnisse wie Support Vector Machines (SVMs) erzielen, auch wenn diese Ergebnisse laut Artikel nicht ganz optimal sind.

Lernvideos zu Künstliches Neuron

Weiterlesen

Künstliches neuronales Netz Ein künstliches neuronales Netz besteht aus mehreren künstlichen Neuronen, die miteinander verbunden sind und in der Regel in Schichten organisiert werden. Im … Neuroinformatik Bei der Neuroinformatik handelt es sich um ein stark interdisziplinäres Forschungsgebiet im Schnittbereich zwischen KI-Forschung und Kognitionswissenschaft. In … Neuronales Netz Als neuronales Netz wird in den Neurowissenschaften eine beliebige Anzahl miteinander verbundener Neuronen bezeichnet, die als Teil eines Nervensystems … Netzwerk Als Netze oder Netzwerke (englisch net oder englisch network) werden interdisziplinär Systeme bezeichnet, deren zugrundeliegende Struktur sich mathematisch … Funktion (Mathematik) In der Mathematik ist eine Funktion (lateinisch functio) oder Abbildung eine Beziehung (Relation) zwischen zwei Mengen, die jedem Element der einen Menge … Approximation Die approximative Darstellung von Funktionen oder Zahlen. Ist ein explizit gegebenes mathematisches Objekt nur schwer handhabbar, dann ist eine Approximation … Nervenzelle Eine Nervenzelle, auch Neuron (von altgriechisch νεῦρον neũron „Flechse, Sehne, Nerv“) genannt, ist eine auf Erregungsleitung und Erregungsübertragung … Maschinelles Lernen Maschinelles Lernen (ML) entwickelt, untersucht und verwendet statistische Algorithmen, auch Lernalgorithmen genannt. Solche Algorithmen können lernen, … Synapse Synapsen dienen der Übertragung von Erregung, erlauben aber auch die Modulation der Signalübertragung, und sie vermögen darüber hinaus durch anpassende … Perzeptron Das Perzeptron (nach engl. perception, „Wahrnehmung“) ist ein vereinfachtes künstliches neuronales Netz, das zuerst von Frank Rosenblatt 1957 vorgestellt … Frank Rosenblatt Frank Rosenblatt (* 11. Juli 1928 in New York City; † 11. Juli 1971 in der Chesapeake Bay) war ein US-amerikanischer Psychologe und Informatiker. Backpropagation Fehlerrückführung bzw. Rückpropagierung ist ein verbreitetes Verfahren zum Einlernen künstlicher neuronaler Netze. Es gehört in der einfachen Form zur Gruppe …