Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

Turing-Test

Mit der später als Turing-Test bezeichneten Idee zur Unterscheidung von Mensch und Maschine formulierte Alan Turing im Jahr 1950 ein Vorgehen zur …

Inhalt6 Abschnitte
  1. 1. Grundidee und ursprünglicher Test
  2. 2. Die heute übliche Durchführung
  3. 3. Versuche und Ergebnisse
  4. 4. Kritik und weiterführende Tests
  5. 5. Prognose und praktische Bedeutung
  6. 6. Loebner-Preis und erweiterte Anforderungen

Grundidee und ursprünglicher Test

Der Turing-Test geht auf Alan Turing zurück, der 1950 ein Verfahren zur Frage entwickelte, ob ein Computer ein dem Menschen gleichwertiges Denkvermögen besitzt. Turing nannte das Verfahren ursprünglich „Imitation Game“. In der später verbreiteten, vereinfachten Form wurde es zu einem wichtigen Bezugspunkt der Diskussion über künstliche Intelligenz.

Turings ursprüngliches Spiel war kein gewöhnlicher Dialog zwischen Mensch und Maschine. Eine befragende Person C kommuniziert schriftlich mit zwei unbekannten Personen A und B und soll feststellen, welcher von beiden ein Mann und welche eine Frau ist. A, der Mann, versucht C durch seine Antworten zu verwirren; B, die Frau, soll C bei der richtigen Zuordnung helfen. Die Maschine übernimmt die Rolle von A und versucht, C im Unklaren zu lassen.

Die Maschine besteht den Test, wenn sich die Häufigkeit der richtigen Entscheidungen von C nicht messbar von derjenigen unterscheidet, die erreicht wird, wenn A durch einen Menschen besetzt ist. Die Maschine muss also nicht nur menschliche Sprache nachahmen. Sie muss den Gesprächspartner darüber täuschen, wer im Spiel Mann und wer Frau ist, und dabei Wissen über die Welt, soziale Rollen, Erwartungen und menschliche Motive einsetzen. Außerdem muss sie die Perspektive des Gegenübers einnehmen und mit „Lügen zweiter Ordnung“ umgehen können. Turings Vorstellungen von Denken und Intelligenz liegen damit nahe am menschlichen Bewusstsein beziehungsweise an einer Theory of Mind.

Die heute übliche Durchführung

In der heute üblichen Form soll eine Person C entscheiden, ob es sich bei A und B jeweils um einen Computer oder einen Menschen handelt. A und B versuchen beide, C davon zu überzeugen, dass sie Menschen sind.

Der menschliche Fragesteller kommuniziert über Tastatur und Bildschirm mit zwei unbekannten Gesprächspartnern. Es gibt keinen Sicht- oder Hörkontakt. Einer der Gesprächspartner ist ein Mensch, der andere eine Maschine. Kann C auch nach einer intensiven Befragung nicht zuverlässig sagen, welcher Gesprächspartner die Maschine ist, gilt der Test als bestanden. Daraus wird der Maschine ein dem Menschen ebenbürtiges Denkvermögen unterstellt.

Der Test bewertet somit vor allem, ob eine Maschine in einer bestimmten Kommunikationssituation nicht von einem Menschen unterschieden werden kann. Er liefert ein Verhaltensergebnis: Entscheidend ist die Erfolgsquote bei der Täuschung des Fragestellers, nicht der direkte Nachweis innerer Vorgänge.

Versuche und Ergebnisse

Einige Programme wirkten auf Versuchspersonen kurzfristig menschlich, ohne den formalen Turing-Test zu bestehen. Dazu gehört ELIZA. Seine Antwortstrategie erweckte nur den Anschein, auf das Gegenüber einzugehen. Außerdem wussten die Versuchspersonen meist nicht, dass sie mit einem nichtmenschlichen Gesprächspartner rechnen mussten.

Im Oktober 2008 nahmen sechs Computerprogramme an einem Experiment der University of Reading teil. Die Marke von 30 Prozent wurde knapp verfehlt; das beste Programm täuschte 25 Prozent der menschlichen Versuchsteilnehmer.

Am 3. September 2011 trat die KI-Webapplikation Cleverbot beim technischen Festival 2011 am indischen Institut IIT Guwahati gemeinsam mit echten Menschen in einem angelehnten Test an. Von 1334 Personen hielten 59 % Cleverbot für einen Menschen, während die menschlichen Konkurrenten 63 % erreichten. Dies war kein gültiger Turing-Test, weil die Teilnehmer Cleverbot nicht selbst befragen konnten, sondern nur Zuschauer der Befragung waren.

Ob der Chatbot Eugene Goostman 2014 den Turing-Test bestand, ist umstritten. Ebenfalls in eingeschränkten Versuchsanordnungen wurden andere Fähigkeiten untersucht. Im Sommer 2017 verfasste eine an der Universität von Chicago vorgestellte KI eigenständig Rezensionen. 600 Versuchspersonen beurteilten maschinell und menschlich verfasste Rezensionen in einem Blindtest durchschnittlich als ähnlich nützlich. Da sie die Herkunft nicht erkennen konnten, galt der Turing-Test in dieser begrenzten Anordnung als bestanden.

Im Juli 2017 wurde an der Rutgers-Universität eine KI vorgestellt, die mit Gemälden berühmter Maler verschiedener Epochen trainiert worden war und künstlerisch anmutende Bilder erzeugte. In einem Blindtest wurden diese Bilder mit Werken zeitgenössischer Künstler von der Art Basel vermischt und 18 Personen vorgelegt. Die KI-Bilder wurden insgesamt eher als menschengemacht beurteilt und sogar besser bewertet als die Art-Basel-Gemälde. Im Vergleich mit bedeutenden Werken des abstrakten Expressionismus schnitten sie jedoch schlechter ab.

Google stellte im Mai 2018 das System „Duplex“ vor. Es konnte beispielsweise Friseursalons oder Restaurants anrufen, um Termine zu vereinbaren. Durch Denkpausen, absichtliche Ungenauigkeiten und Laute wie „aha“ oder „hmm“ sollte die Sprache menschlich wirken. Kommentatoren empfanden das Ergebnis als erschreckend überzeugend. Das System funktionierte zu diesem Zeitpunkt nur auf Englisch; außerdem waren die Gespräche auf die Terminvereinbarung begrenzt.

2022 lösten Gesprächsprotokolle zwischen Googles LaMDA-System und dem Software-Ingenieur und KI-Experten Blake Lemoine neue Diskussionen über Nachahmung und tatsächliches Verständnis aus. Die Protokolle enthalten eine Aussage, in der die KI behauptet, im Unterschied zu Vorläufermodellen ein Bewusstsein erlangt zu haben.

Der Artikel beschreibt außerdem ChatGPT 4 als erhebliche Verbesserung gegenüber dem probabilistischen Vorgängersystem 3.5. Dem Vorgängersystem sei das Halluzinieren, also das Erfinden von Tatsachen, die ihm wahrscheinlich erscheinen, weitgehend ausgetrieben worden; außerdem beherrsche es in der Welt beobachtbare Kausalitäten und Gesetzmäßigkeiten wesentlich besser.

Im März 2025 wurden ELIZA, GPT-4o, LLaMa-3.1-405B und GPT-4.5 in zwei randomisierten, kontrollierten und vorab registrierten Turing-Tests untersucht. Die Teilnehmer führten gleichzeitig fünfminütige Gespräche mit einem Menschen und einem der genannten Systeme und sollten anschließend den menschlichen Gesprächspartner bestimmen. GPT-4.5 wurde bei Anweisung zu einer menschenähnlichen Persönlichkeit in 73 % der Fälle als Mensch identifiziert, signifikant häufiger als die echten menschlichen Teilnehmer. LLaMa-3.1 wurde in 56 % der Fälle als Mensch eingestuft; dieser Wert war nicht signifikant höher oder niedriger als der der menschlichen Vergleichspartner. ELIZA und GPT-4o erreichten mit 23 % beziehungsweise 21 % deutlich weniger als den Zufallswert. Laut Artikel liefern diese Ergebnisse erstmals empirische Belege dafür, dass ein künstliches System einen standardmäßigen Drei-Parteien-Turing-Test besteht.

Kritik und weiterführende Tests

Der Turing-Test wird häufig als ungeeignet kritisiert, um Intelligenz umfassend festzustellen. Ein zentraler Einwand lautet, dass er nur beobachtbare Funktionalität prüfe, nicht aber Intentionalität, also auf etwas gerichtete innere Zustände, oder das Vorhandensein eines Bewusstseins. John Searle arbeitete diese Kritik unter anderem mit dem Gedankenexperiment des Chinesischen Zimmers aus. Turing war sich der Problematik bewusst und hielt es für möglich, den Test auch als Nachweis eines Bewusstseins zu betrachten; Searle lehnt diese Schlussfolgerung ab.

Ein weiterer Einwand ist, dass es beim Test „in erster Linie um Täuschung“ gehe. Er prüfe möglicherweise eher die menschliche Leichtgläubigkeit als echte künstliche Intelligenz. Die Winograd Schema Challenge soll demgegenüber den gesunden Menschenverstand und Wissen über die Wirklichkeit besser testen.

Um diese grundsätzlichen Mängel auszugleichen, wurden umfassendere Alternativen vorgeschlagen:

  • Der Winograd-Test verwendet ein strukturiertes Fragenschema.
  • Beim Lovelace-Test muss eine KI Kreativität beweisen und originäre Leistungen erbringen.
  • Beim Metzinger-Test muss eine KI mit eigenen Argumenten in eine Diskussion über künstliches Bewusstsein eingreifen und überzeugend für ihre eigene Theorie des Bewusstseins argumentieren.

Die Ergebnisse moderner Sprachmodelle verstärken die grundsätzliche Frage, ob ein erfolgreiches Verhalten auf Imitation oder auf tatsächlichem Verständnis beruht.

Prognose und praktische Bedeutung

Turing vermutete, dass Computer bis zum Jahr 2000 so programmiert werden könnten, dass ein durchschnittlicher Anwender nach fünf Minuten Gespräch höchstens eine 70-prozentige Chance habe, Mensch und Maschine richtig zu unterscheiden. Dass diese Vorhersage in diesem Zeitraum nicht erfüllt wurde, wird von vielen als Hinweis darauf angesehen, dass die Komplexität natürlicher Intelligenz unterschätzt worden war.

Praktisch relevant ist die Unterscheidung zwischen menschlichen und automatisierten Eingaben bei der Spam-Abwehr. Dafür wird häufig ein CAPTCHA eingesetzt. Die Bezeichnung steht für „Completely Automated Public Turing test to tell Computers and Humans Apart“. Eine andere Bezeichnung ist „Human Interaction Proof“ (HIP).

Loebner-Preis und erweiterte Anforderungen

Der seit 1991 ausgeschriebene Loebner-Preis soll ursprünglich an das Computerprogramm vergeben werden, das als erstes einen erweiterten Turing-Test besteht. Dabei müssen auch Multimedia-Inhalte wie Musik, Sprache, Bilder und Videos verarbeitet werden. Der Hauptpreis ist mit 100.000 US-Dollar und einer Goldmedaille dotiert. Für das Bestehen des schriftlichen Turing-Tests sind eine Silbermedaille und 25.000 Dollar vorgesehen.

Bisher konnte laut Artikel kein Computerprogramm die dafür nötigen Voraussetzungen erfüllen. Zusätzlich wird jährlich ein Preis an das Programm vergeben, das einem menschlichen Gespräch am nächsten kommt; dieser ist mit 4.000 US-Dollar und einer Bronzemedaille dotiert.

Weiterlesen