Zum Inhalt springen
L

Wikipedia · einfach zusammengefasst · Stand

AlphaGo

AlphaGo ist ein Computerprogramm, das das Brettspiel Go spielt und von DeepMind entwickelt wurde und sich auch gegen professionelle Spieler durchsetzen …

Inhalt5 Abschnitte
  1. 1. Was AlphaGo ist und warum Go schwierig ist
  2. 2. Lernnetze und Baumsuche
  3. 3. Siege gegen professionelle Go-Spieler
  4. 4. Match gegen Ke Jie
  5. 5. AlphaGo Zero und AlphaZero

Was AlphaGo ist und warum Go schwierig ist

AlphaGo ist ein von DeepMind entwickeltes Computerprogramm für das Brettspiel Go. Es konnte auch professionelle Spieler besiegen. Dafür verbindet es maschinelles Lernen mit der Traversierung, also dem systematischen Durchsuchen, von Spielvarianten.

Go galt nach dem Sieg von IBMs Deep Blue gegen Garri Kasparow im Mai 1997 als nächste große Herausforderung der künstlichen Intelligenz. Auf dem 19×19-Brett gibt es sehr viel mehr mögliche Züge als im Schach. Deshalb ist die reine Brute-Force-Suche mit Alpha-Beta-Suche, bei der mögliche Züge umfassend ausprobiert werden, praktisch nicht ausreichend. Außerdem gab es für Go lange keine zweckmäßigen heuristischen Methoden: Das sind vereinfachte Regeln, mit denen eine Stellung bewertet werden kann.

Ende der 1990er Jahre waren Go-Programme kaum stärker als ambitionierte menschliche Anfänger. Ab 2006 verbesserten Monte-Carlo-Algorithmen die Programme deutlich. Sie bewerten Zugkandidaten statistisch, indem sie von einer Stellung aus mit Zufallszügen bis zum Spielende weiterspielen. Programme wie Crazy Stone und Zen erreichten dadurch das Niveau sehr guter Amateure; auf 9×9-Brettern oder mit vier Steinen Vorgabe gelangen auch Siege gegen Profis. AlphaGo gewann von 500 Spielen gegen andere Programme, darunter Crazy Stone und Zen, alle bis auf eines.

Lernnetze und Baumsuche

AlphaGo kombiniert drei Bausteine in einer Monte-Carlo-Baumsuche:

  • Das policy network („Regelnetzwerk“) wählt aussichtsreiche Zugkandidaten. Es wird zunächst mit vielen Partien durch überwachtes Lernen und anschließend durch bestärkendes Lernen trainiert.
  • Das value network („Bewertungsnetzwerk“) schätzt, wie gut eine Spielposition ist. Es wird durch bestärkendes Lernen eingestellt.
  • Die Monte-Carlo-Baumsuche berechnet mögliche Varianten und verbindet dabei die Ergebnisse beider Netze.

Zuerst analysierte AlphaGo eine Datenbank von 30 Millionen Zügen und lernte, menschliche Züge vorherzusagen. Dies gelang zu 56 %. Anders als bei reinen Monte-Carlo-Programmen muss AlphaGo zur Positionsbewertung nicht jede Partie vollständig bis zum Ende simulieren. Bereits dieser Lernansatz konnte traditionelle Programme besiegen; für die stärkste Version wurden zusätzlich Monte-Carlo-Bewertungen genutzt.

Der Ansatz ist grundsätzlich auch auf andere Anwendungsgebiete übertragbar. Beim Match gegen Fan Hui nutzte die verteilte Version einen Rechnerverbund mit 1202 CPUs, 178 GPUs und 40 Such-Threads. Gegen Lee Sedol wurden 1920 CPUs und 280 GPUs eingesetzt. Für das Training standen Google Cloud Platform und Tensor Processing Units zur Verfügung, also ASICs für die Software-Sammlung TensorFlow.

Siege gegen professionelle Go-Spieler

Im Oktober 2015 besiegte AlphaGo den mehrfachen Europameister Fan Hui, 2. Profi-Dan, mit 5:0. Es war damit das erste Programm, das unter Turnierbedingungen ohne Vorgabe auf einem 19×19-Brett einen professionellen Go-Spieler schlagen konnte. Im vierten Spiel am 8. Oktober 2015 spielte AlphaGo Schwarz und gewann, weil Fan Hui mit Weiß aufgab.

Ab dem 9. März 2016 spielte AlphaGo in Seoul gegen den südkoreanischen Profi Lee Sedol, 9. Dan, der zu den besten Spielern der Welt gerechnet wurde. Gespielt wurde nach chinesischer Wertung mit einem Komi von 7,5. AlphaGo gewann das Match über fünf Partien mit 4:1; Lee Sedol gewann nur die vierte Partie mit Weiß. Da AlphaGo die ersten drei Partien gewann, stand es bereits nach der dritten Partie als Matchgewinner fest. Alle fünf Partien endeten durch Aufgabe. AlphaGo war damit das erste Computerprogramm, das einen professionellen Spieler dieser Spielstärke mehrfach und ohne Handicap schlug. Der südkoreanische Go-Verband Hanguk Kiwon verlieh AlphaGo danach den höchsten Rang 9p eines 9. professionellen Dan.

Match gegen Ke Jie

Beim Wuzhen Future of Go Summit 2017 in Wuzhen, China, spielte AlphaGo vom 23.–27. Mai 2017 gegen den Weltranglistenersten Ke Jie. Ke Jie verlor alle drei Partien gegen AlphaGo. Im selben Zeitraum spielte AlphaGo außerdem gegen ein Team aus fünf Top-Spielern, die jeden Zug gemeinsam planen durften. Auch dieses Match gewann AlphaGo.

AlphaGo Zero und AlphaZero

AlphaGo Zero wurde im Oktober 2017 als jüngste Entwicklungsstufe vorgestellt. Es erhielt keinerlei Vorwissen über Go, sondern nur die Spielregeln und trainierte ausschließlich durch Partien gegen sich selbst. Seine Software- und Hardware-Architektur waren verändert und reduziert; beim Inferencing genügten vier Tensor Processing Units. AlphaGo Zero wurde ebenfalls mit TensorFlow entwickelt.

Schon nach 3 Tagen war AlphaGo Zero stärker als die Version, die Lee Sedol besiegt hatte, und gewann gegen sie 100:0. Nach 40 Tagen Training schlug es auch AlphaGo Master, die zuvor stärkste Ausbaustufe.

Im Dezember 2017 stellte DeepMind AlphaZero vor. Diese KI lernte nacheinander Schach, Go und Shogi innerhalb weniger Stunden und war danach besser als jede zuvor entwickelte Software. Auch AlphaZero wird nur mit den Spielregeln programmiert und trainiert dann einige Stunden gegen sich selbst. Menschliche Spielstrategien werden ihr nicht gezeigt; die KI entwickelt ihre Strategien eigenständig.

Weiterlesen

Maschinelles Lernen Maschinelles Lernen (ML) entwickelt, untersucht und verwendet statistische Algorithmen, auch Lernalgorithmen genannt. Solche Algorithmen können lernen, … Binärbaum Binärbäume sind in der Informatik die am häufigsten verwendete Unterart der Bäume. Im Gegensatz zu anderen Arten von Bäumen können die Knoten eines … Convolutional Neural Network Im Jahr 1987 trainierte Alex Waibel ein CNN namens TDNN durch Backpropagation und erzielte damit Bewegungsinvarianz. Auch Yann LeCun publizierte ab dem … Neuronales Netz Als neuronales Netz wird in den Neurowissenschaften eine beliebige Anzahl miteinander verbundener Neuronen bezeichnet, die als Teil eines Nervensystems … Suchbaum In der Informatik ist ein Suchbaum eine abstrakte Datenstruktur, bei der die Menge von Elementen, in der gesucht werden soll, in einer Baumstruktur … Überwachtes Lernen Überwachtes Lernen (englisch supervised learning) ist eine wichtige Kategorie des Maschinellen Lernens. Dabei wird ein Lernalgorithmus mit Datensätzen … Bestärkendes Lernen Bestärkendes Lernen. Reihe von Methoden des maschinellen Lernens, bei denen ein Agent selbständig eine Strategie erlernt, um erhaltene Belohnungen zu maximieren. Thread (Informatik) Kritischer Abschnitt · Nebenläufigkeit · Parallele Programmierung · Prozess · Threadsicherheit. Literatur. Bearbeiten. Peter Ziesche: Nebenläufige & verteilte … Anwendungsspezifische integrierte Schaltung Eine anwendungsspezifische integrierte Schaltung (englisch application-specific integrated circuit, ASIC, auch Custom Chip) ist ein integrierter Schaltkreis … YouTube YouTube bietet drei Formen der Zugänglichkeit an: Öffentlich, Ungelistet oder Privat. Standard sind öffentliche Videos. Diese sind von jedermann anzusehen und … Künstliche Intelligenz Künstliche Intelligenz (kurz KI, englisch artificial intelligence, kurz AI) ist ein Forschungs- und Anwendungsgebiet der Informatik.