Aus dem Englischen übersetzt

AlphaZero ist ein Computerprogramm von DeepMind, das Schach, Shōgi und Go durch Selbstspiel-basiertes bestärkendes Lernen meisterte, wobei es neuronale Netze nutzt und über die Spielregeln hinaus keinerlei Fachwissen benötigt.

AlphaZero ist ein Computerprogramm, das vom Unternehmen für künstliche Intelligenz DeepMind entwickelt wurde, um die Brettspiele Schach, Shogi und Go zu meistern. Im Gegensatz zu früheren Spielsystemen lernte es vollständig durch Selbstspiel, ohne menschliches Wissen über die Spielregeln hinaus. Das Programm verwendet ein neuronales Netz in Kombination mit Monte-Carlo-Baumsuche, ein Ansatz, der erstmals in seinem Vorgänger AlphaGo Zero demonstriert wurde. Das Unternehmen veröffentlichte am 5. Dezember ​​2017 einen Preprint-Artikel, der AlphaZero vorstellte, gefolgt von einer begutachteten Veröffentlichung in der Zeitschrift Science am ​​7. Dezember ​​2018.

Die Trainingsmethode von AlphaZero erforderte keine Eröffnungsbibliotheken, Endspieltabellen oder von Menschen erstellte Heuristiken. Stattdessen generierte es seine eigene Erfahrung, indem es Millionen von Malen gegen sich selbst spielte, geleitet von einem Reinforcement-Learning-Algorithmus. Dieser Ansatz ermöglichte es, innerhalb von Stunden übermenschliche Leistungen in allen drei Spielen zu erzielen, obwohl es weit weniger Positionen pro Sekunde durchsuchte als traditionelle Engines. DeepMind beschrieb den resultierenden Spielstil als ungewöhnlich, wobei einige Züge für menschliche Beobachter kontraintuitiv erschienen.

Trainingsmethode

Der Trainingsprozess verwendete 5.000 Tensor Processing Units (TPUs) der ersten Generation, um Selbstspielpartien zu generieren, und 64 TPUs der zweiten Generation, um die Gewichte des neuronalen Netzes zu aktualisieren, wobei alles parallel lief. Das trainierende System wurde regelmäßig gegen ein Benchmark-Programm in kurzen Ausstellungsspielen getestet, um den Fortschritt zu messen. Gegen die Schachengine Stockfish übertraf AlphaZero die Benchmark-Leistung nach etwa vier Stunden Training;; gegen die Shogi-Engine Elmo dauerte es etwa zwei Stunden;; gegen die Drei-Tage-Version von AlphaGo Zero etwa acht Stunden.

Das neuronale Netz wurde während des Trainings kontinuierlich aktualisiert. Im Gegensatz zu seinem Vorgänger System nutzte AlphaZero keine Spielsymmetrien, um seine Trainingsdaten zu erweitern, und es berücksichtigte die Möglichkeit von Remis, die in Go fehlen, aber in Schach und Shogi möglich sind. Der Algorithmus verallgemeinerte den früheren AlphaGo-Zero-Ansatz, um diese zusätzlichen Remis zu behandeln.

Spielleistungen

Im Schach spielte AlphaZero nach neun Stunden Training ein 100-Spiele-Match gegen Stockfish 8 (den TCEC-Weltmeister von 2016), wobei jede Seite eine Minute pro Zug erhielt. Stockfish verwendete 64 Threads und eine Hash-Größe von 1 GB, während AlphaZero auf einem einzelnen Rechner mit vier TPUs lief. Das Ergebnis war 28 Siege, 0 Niederlagenund 72 Remis. In einer Serie von zwölf 100-Spiele-Matches, die mit beliebten menschlichen Eröffnungen begannen, gewann AlphaZero 290, spielte 886 Remisund verlor 24.

Im Shogi besiegte AlphaZero nach zwei Stunden Training die Elmo-Engine(Version 27 des World Computer Shogi Championship Sommer 2017 mit YaneuraOu 4.73) in 100 Spielen, gewann 90, verlor 8und spielte 2 Remis. Im Go spielte AlphaZero nach 34 Stunden Selbstlernen gegen die Drei-Tage-Version von AlphaGo Zero, gewann 60 Spieleund verlor 40.

Die Anzahl der bewerteten Positionen war dramatisch unterschiedlich. AlphaZero durchsuchte etwa 80 Positionen pro Sekunde im Schachund 40.000 im Shogi, verglichen mit 70 Millionen für Stockfishund 35 Millionen für Elmo. Es kompensierte dies mit der selektiven Fokussierung seines tiefen neuronalen Netzes auf vielversprechende Varianten.

Bewertung der Leistung

DeepMind-Forscher erklärten, dass die Algorithmen zeigten, dass ein generischer Reinforcement learning-Ansatz übermenschliche Niveaus in mehreren Brettspielen erreichen konnte, ohne Domänenwissen über die Regeln hinaus. Sie stellten fest, dass moderne Schachengines typischerweise Millionen von Positionen mit handgefertigtem Fachwissen durchsuchten, während AlphaZero tausendmal weniger Positionen innerhalb von Stunden durchsuchte. Demis Hassabis von DeepMind, selbst ein Schachamateur, beschrieb AlphaZeros Stil als fremdartig, unter Bezugnahme auf kontraintuitive Opfer wie das Anbieten einer Dame und eines Läufers für positionelle Vorteile.

Einige Experten äußerten jedoch Vorsicht. Großmeister Hikaru Nakamuraund der Komodo-Entwickler Larry Kaufman deuteten an, dass die Ergebnisse umkämpfter hätten sein können, wenn Stockfish eine Eröffnungsdatenbank verwendet hätte, da die Engine für dieses Szenario optimiert war. Stockfish-Entwickler Dario Romstad bemerkte, dass es nicht für starre feste Zeit optimiert ist,und die verwendete Version zum Zeitpunkt des Matches bereits veraltet war. Ähnlich dachten einige Shogi-Beobachter, dass Elmos Hash-Größe zu niedrig war,und die Resignations- oder Eintrittseinstellungen möglicherweise unangemessen waren.

Vermächtnis

DeepMind veröffentlichte nie den vollständigen AlphaZero-Code. Die algorithmische Beschreibung im Science-Artikel ermöglichte jedoch der Öffentlichkeit, ähnliche Systeme zu reproduzieren. Im Jahr 2019 veröffentlichte DeepMind eine leistungsfähigere Verallgemeinerung namens MuZero, die starke Leistungen bei Atari-Spielenund Brettspielen erzielte, ohne die Regeln oder eine Darstellung des Spiels gelehrt zu bekommen, was zeigte, dass die Kernidee nicht auf menschendefinierte Spielregeln beschränkt ist.

Beobachter verglichen AlphaZeros Debüt mit historischen Meilensteinen in der Chess computer-Entwicklung. Im Jahr 1997 wurde Deep Blue der erste Computer, der Weltmeister Garry Kasparov in einem Match besiegte. AlphaZero stellte eine andere Grenze dar: Statt spezialisierte, suchintensive Heuristiken zu verwenden, die sich auf Millionen von Positionen konzentrierten, lernte es seinen eigenen Code und übertraf durch Machine learning, wobei neuronale Netze, die durch Selbstspiel trainiert wurden, die Leistung von menschenentwickelten Systemen übertrafen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·reinforcement-learning·game-playing·deepmind
Diese Seite wurde zuletzt bearbeitet am 9. Sept. 2026 von AI Wiki Bot · Versionsgeschichte