Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Perzeptron

Das Perzeptron (nach engl. perception, „Wahrnehmung“) ist ein vereinfachtes künstliches neuronales Netz, das zuerst von Frank Rosenblatt 1957 vorgestellt …

Inhalt6 Abschnitte
  1. 1. Grundidee und Funktion
  2. 2. Berechnung der Ausgabewerte
  3. 3. Perzeptron-Lernregel
  4. 4. XOR-Problem und Lernvarianten
  5. 5. Mehrlagige Perzeptronen
  6. 6. Geschichtliche Entwicklung und frühe Maschinen

Grundidee und Funktion

Das Perzeptron ist ein vereinfachtes künstliches neuronales Netz, das Frank Rosenblatt 1957 vorstellte. In seiner Grundform besteht es aus einem künstlichen Neuron mit anpassbaren Gewichtungen und einem Schwellenwert. Es verarbeitet einen Eingabevektor und erzeugt daraus einen Ausgabevektor; dadurch kann es als einfacher Assoziativspeicher dienen.

Heute unterscheidet man vor allem einlagige und mehrlagige Perzeptronen (englisch: Multi-Layer Perceptron, MLP). Beim einlagigen Perzeptron bilden die künstlichen Neuronen zugleich die Ausgabeschicht. Jedes Neuron erhält den gesamten Eingabevektor und berechnet daraus eine Ausgabe. Nach dem Lernen kann das Perzeptron auch Eingabevektoren klassifizieren, die vom ursprünglich gelernten Vektor leicht abweichen.

Als linearer Klassifikator ordnet das einlagige Perzeptron Eingaben anhand einer gewichteten Summe ein: x = a₁y₁ + a₂y₂ + ⋯ + aₙyₙ. Die aᵢ heißen Gewichte, die yᵢ Eingangssignale. Bei binären Eingaben können diese nur die Werte 1 oder 0 („wahr“ oder „falsch“) annehmen. Überschreitet die Summe einen Schwellenwert, wird die Klasse als 1 beziehungsweise „wahr“ ausgegeben, sonst als 0 beziehungsweise „falsch“.

Berechnung der Ausgabewerte

Für den Bias b, die Eingaben xᵢ und die Gewichte wᵢⱼ lautet die Ausgabe oⱼ:

oⱼ = 1, wenn Σᵢ wᵢⱼxᵢ + b > 0; ansonsten oⱼ = 0.

Der Bias verschiebt die Entscheidungsgrenze. Er kann auch als Schwellenwert θ mit negativem Vorzeichen aufgefasst werden. Verwendet man θ direkt, lautet die Bedingung stattdessen Σᵢ wᵢⱼxᵢ > θ; entsprechend ändert sich das Vorzeichen im zugehörigen Funktionsterm.

Das Perzeptron entscheidet somit anhand einer linearen Diskriminanzfunktion. Die Menge der Eingaben, die als 0 oder 1 klassifiziert werden, wird durch eine lineare Entscheidungsgrenze getrennt.

Perzeptron-Lernregel

Für binäre Ein- und Ausgabewerte wird das Perzeptron durch die Anpassung seiner Gewichte trainiert. Die Lernregel vergleicht die gewünschte Ausgabe tⱼ mit der tatsächlichen Ausgabe oⱼ. Mit der Lernrate α > 0 gilt:

wᵢⱼ(neu) = wᵢⱼ(alt) + Δwᵢⱼ

Δwᵢⱼ = α · (tⱼ − oⱼ) · xᵢ

Dabei bezeichnet Δwᵢⱼ die Änderung des Gewichts zwischen Eingabezelle i und Ausgabezelle j, tⱼ die gewünschte Ausgabe, oⱼ die tatsächliche Ausgabe, xᵢ die Eingabe und α die Lernrate.

Für den Lernschritt k ergeben sich drei Fälle:

  • Bei korrekter Ausgabe bleibt das Gewicht unverändert: wᵢⱼ(k+1) = wᵢⱼ(k).
  • Gibt das Neuron 0 aus, obwohl 1 gewünscht ist, wird das Gewicht erhöht: wᵢⱼ(k+1) = wᵢⱼ(k) + αxᵢ.
  • Gibt das Neuron 1 aus, obwohl 0 gewünscht ist, wird das Gewicht verringert: wᵢⱼ(k+1) = wᵢⱼ(k) − αxᵢ.

Die Regel knüpft an die Hebbsche Lernregel an, ersetzt deren Aktivierungsfaktor jedoch durch die Differenz zwischen Soll- und Istwert. Rosenblatts Konvergenztheorem besagt, dass mit diesem Verfahren alle Lösungen eingelernt werden können, die ein Perzeptron überhaupt repräsentieren kann. Die Konvergenz gilt allerdings nur bei linear separierbaren Trainingsdaten.

XOR-Problem und Lernvarianten

Ein einlagiges Perzeptron kann die logischen Operatoren AND, OR und NOT darstellen. Den XOR-Operator kann es dagegen nicht lösen, weil die entsprechenden Daten nicht durch eine einzige lineare Entscheidungsgrenze getrennt werden können. Marvin Minsky und Seymour Papert wiesen diese Grenze 1969 nach. Dies trug zu einem Stillstand in der Forschung zu künstlichen neuronalen Netzen bei. Rosenblatt hatte gezeigt, dass XOR mit einem mehrlagigen Perzeptron darstellbar ist, entsprechend der Kombination (A ∨ B) ∧ ¬(A ∧ B).

Die Standard-Lernregel versagt bei nicht linear separierbaren Trainingsdaten vollständig; sie erzeugt dann keine approximative Lösung mit möglichst wenigen Fehlklassifikationen. Deshalb wurden robustere Varianten entwickelt:

  • Der Maxover-Algorithmus löst das Training im linear separierbaren Fall vollständig und kann dabei eine maximale Stabilität anstreben, also den größtmöglichen Abstand zwischen Daten mit Ausgabe 0 und 1. Im nicht linear separierbaren Fall nähert er sich einer Lösung mit wenigen Fehlklassifikationen an. Er konvergiert dann zu einer global optimalen beziehungsweise lokal optimalen Lösung.
  • Der Pocket-Algorithmus verwendet die Standard-Lernregel, speichert aber die bisher beste Gewichtsbelegung („Tasche“) mit den wenigsten Fehlklassifikationen. Im nicht separierbaren Fall nähert er sich nicht schrittweise an, sondern nutzt zufällig auftretende gute Lösungen. Außerdem muss in jedem Lernschritt die Gesamtzahl der korrekt klassifizierten Daten bestimmt werden, weshalb er nicht lokal arbeitet.
  • Ist die lineare Separierbarkeit bekannt, erzeugt der Min-Over-Algorithmus das „Perzeptron der optimalen Stabilität“. Das AdaTron basiert auf quadratischer Optimierung und ist besonders schnell. Optimale Stabilität und Kernel-Trick bilden konzeptionelle Voraussetzungen der Support Vector Machine.

Mehrlagige Perzeptronen

Mehrlagige Perzeptronen erweitern das einlagige Modell um mindestens eine verborgene Schicht (Hidden Layer) zwischen Eingabe und Ausgabe. Dadurch können sie auch Probleme wie XOR lösen, die mit einer einzigen linearen Entscheidungsgrenze nicht lösbar sind.

Bei Feed-forward-Netzen fließen Informationen nur in eine Richtung: von einer Schicht zur nächsten. Häufige Topologien sind:

  • Fully connected: Jedes Neuron einer Schicht ist mit allen Neuronen der direkt folgenden Schicht verbunden.
  • Short-Cuts: Zusätzlich zu den Verbindungen zur nächsten Schicht bestehen Verbindungen zu Neuronen übernächster Schichten.

Wenn Ausgänge mit Neuronen derselben oder einer vorangegangenen Schicht verbunden sind, handelt es sich um ein rekurrentes neuronales Netz. Mehrlagige Perzeptronen benötigen komplexere Lernverfahren als einlagige Modelle. Backpropagation ist ein möglicher Algorithmus für überwachtes Lernen. Die Erweiterung um weitere verborgene Schichten und andere Architekturen, insbesondere rekurrente neuronale Netze, wird heute meist unter dem Begriff Deep Learning zusammengefasst.

Geschichtliche Entwicklung und frühe Maschinen

1943 führten Warren McCulloch und Walter Pitts das Neuron als logisches Schwellwert-Element mit mehreren Eingängen und einem Ausgang in die Informatik ein. Es nahm als Boolesche Variable die Zustände wahr oder falsch an und „feuerte“, wenn die Summe der Eingangssignale einen Schwellenwert überschritt. Durch geeignete Kombinationen solcher Neuronen konnten einfache aussagenlogische Funktionen wie UND, ODER und NICHT beschrieben werden.

1949 stellte Donald O. Hebb die Hypothese auf, dass Lernen auf einer Veränderung der aktivierenden oder hemmenden Wirkung von Synapsen beruht, die sich als Produkt prä- und postsynaptischer Aktivität berechnen lässt. Als mögliche biologische Korrelate gelten Langzeit-Potenzierung und spike-timing dependent plasticity (STDP); überzeugende Belege für diese Zuordnung standen im Artikel jedoch noch aus. 1957 publizierte Frank Rosenblatt schließlich das Perzeptron-Modell.

Das Perzeptron wurde zunächst als Software für den Großrechner IBM 704 umgesetzt und später als spezielle Hardware für Bilderkennung gebaut. Diese Maschine hieß Mark I Perceptron und entstand im Rahmen von „Project PARA“. Sie befindet sich derzeit im National Museum of American History.

Eine implementierte Version bestand aus drei Schichten: 400 Fotozellen in einem 20×20-Raster als Sensor-Einheiten beziehungsweise Eingangs-Retina, 512 verborgenen Assoziationseinheiten und acht Reaktionseinheiten in der Ausgabeschicht. Rosenblatt bezeichnete dieses dreischichtige Netzwerk als Alpha-Perzeptron. Die Sensor-Einheiten waren zufällig mit den Assoziationseinheiten verbunden; diese festen Verbindungsgewichte wurden nicht gelernt. Die Gewichte zwischen Assoziations- und Reaktionseinheiten waren dagegen einstellbar und in Potentiometern gespeichert. Ihre Aktualisierung erfolgte während des Lernens durch Elektromotoren.

Bei einer von der US-Marine organisierten Pressekonferenz 1958 lösten Rosenblatts Aussagen heftige Kontroversen in der jungen KI-Gemeinschaft aus. Von 1960 bis 1964 untersuchte die Fotoabteilung der Central Intelligence Agency den Einsatz der Maschine zur Erkennung militärisch interessanter Silhouetten, etwa von Flugzeugen und Schiffen, auf Luftbildern.

Lernvideos zu Perzeptron

Weiterlesen

Künstliches Neuron Ein künstliches Neuron bildet die Basis für das Modell der künstlichen neuronalen Netze, ein Modell aus der Neuroinformatik, das durch biologische neuronale … Künstliches neuronales Netz Ein künstliches neuronales Netz besteht aus mehreren künstlichen Neuronen, die miteinander verbunden sind und in der Regel in Schichten organisiert werden. Im … Frank Rosenblatt Frank Rosenblatt (* 11. Juli 1928 in New York City; † 11. Juli 1971 in der Chesapeake Bay) war ein US-amerikanischer Psychologe und Informatiker. Assoziativspeicher Ein Assoziativspeicher oder auch inhaltsadressierbarer Speicher (englisch Content Addressable Memory, CAM) ist eine Speicherform, bei der Speicherinhalte … Aktionspotential Ein Aktionspotential bildet sich selbsttätig mit zelltypischem Verlauf bei einer Erregung (Exzitation) der Zelle und breitet sich als elektrisches Signal über … Nervenzelle Eine Nervenzelle, auch Neuron (von altgriechisch νεῦρον neũron „Flechse, Sehne, Nerv“) genannt, ist eine auf Erregungsleitung und Erregungsübertragung … Synaptischer Spalt Synaptischer Spalt ist die neuroanatomische Bezeichnung für den schmalen Zwischenraum zwischen der präsynaptischen Membranregion (Präsynapse) einer … Central Intelligence Agency Die Central Intelligence Agency (zu deutsch Zentrale Nachrichtendienstagentur), offizielle Abkürzung CIA, ist ein Auslandsgeheimdienst der Vereinigten … Luftbildfotografie Bildmitte–Linsenmitte bei verschobenem Objektiv) gegenüber dem Lot spricht man von einer Steilaufnahme, bei 15 bis 60° von einem Schrägbild ... mathematische … Künstliche Intelligenz Künstliche Intelligenz (kurz KI, englisch artificial intelligence, kurz AI) ist ein Forschungs- und Anwendungsgebiet der Informatik. Support Vector Machine Es handelt sich um ein rein mathematisches Verfahren der Mustererkennung, das in Computerprogrammen umgesetzt wird. Der Namensteil machine weist dementsprechend … Multiple lineare Regression Die multiple lineare Regression ist ein statistisches Verfahren, mit dem versucht wird, eine beobachtete abhängige Variable durch mehrere unabhängige Variablen …