Aus dem Englischen übersetzt

OpenAI Five war ein KI-System von OpenAI, das 2019 Weltmeister im Videospiel Dota 2 besiegte und damit fortgeschrittenes Reinforcement Learning in komplexen Echtzeitumgebungen demonstrierte.

OpenAI Five ist ein Computerprogramm, das von OpenAI entwickelt wurde und das Fünf-gegen-Fünf-Videospiel Dota 2 spielt. Es war das erste System der künstlichen Intelligenz, das die amtierenden Weltmeister in einem professionellen Esports-Match besiegte, was im April 2019 gelang. Das Projekt zielte darauf ab, das maschinelle Lernen voranzutreiben, indem es ein Spiel mit kontinuierlichen Aktionsräumen, teilweiser Beobachtbarkeit und langfristiger Strategie bewältigte, um so allgemeinere Problemlösungssysteme zu schaffen.

Die Entwicklung des Systems begann im November 2016, und sein erster öffentlicher Auftritt war beim The International 2017, wo es den Profispieler Dendi in einem Eins-gegen-Eins-Match besiegte. Bis 2018 konnte es als vollständiges Team von fünf Spielern antreten, und 2019 gewann es eine Best-of-Three-Serie gegen OG, die Champions des The International 2018. Die Algorithmen von OpenAI Five wurden später für andere Projekte angepasst, darunter eine Roboterhand. Es wird oft mit anderen spielenden KI-Systemen wie AlphaGo, Deep Blue und AlphaStar verglichen.

Geschichte

OpenAI begann im November 2016 mit der Entwicklung der Algorithmen für die Dota-2-Bots. Das Unternehmen wählte Dota 2, weil es auf der Streaming-Plattform Twitch beliebt war, native Linux-Unterstützung bot und eine Anwendungsprogrammierschnittstelle (API) für Entwickler bereitstellte. Die erste öffentliche Demonstration fand im August beim The International 2017 statt, wo der Bot den ukrainischen Profispieler Dendi in einem Live-Eins-gegen-Eins-Match besiegte. Nach dem Match erklärte OpenAI-CTO Greg Brockman, dass der Bot durch Selbstspiel über zwei Wochen Echtzeit gelernt hatte, unter Verwendung von bestärkendem Lernen, einer Methode, bei der das System durch Versuch und Irrtum verbessert wird.

Bis Juni 2018 konnten die Bots als vollständiges Team von fünf Spielern zusammenarbeiten und besiegten Amateur- und Semiprofiteams. Beim The International 2018 spielte OpenAI Five zwei Ausstellungsmatches gegen Profiteams - paiN Gaming und ein All-Star-Team ehemaliger chinesischer Spieler - verlor jedoch beide. Trotz der Niederlagen betrachtete OpenAI das Ereignis als Erfolg, da es wertvolle Daten zur Verfeinerung der Algorithmen lieferte. Die letzte öffentliche Demonstration war im April 2019, als OpenAI Five eine Best-of-Three-Serie gegen OG, die amtierenden Weltmeister, bei einem Live-Event in San Francisco gewann. Im selben Monat ermöglichte ein Online-Event der Öffentlichkeit, gegen die Bots zu spielen; über vier Tage spielten die Bots 42.729 Spiele und gewannen 99,4 % davon.

Architektur

Jeder OpenAI-Five-Bot war ein neuronales Netzwerk mit einer einzelnen Schicht, die ein LSTM (Long Short-Term Memory) mit 4096 Einheiten enthielt, das den aktuellen Spielzustand aus der Dota-2-API verarbeitete. Das Netzwerk erzeugte Aktionen über mehrere Aktionsköpfe, die jeweils eine spezifische Bedeutung hatten, wie die Verzögerung vor einer Aktion, den Aktionstyp und die Zielkoordinaten. Das System beobachtete die Welt als eine Liste von 20.000 Zahlen und erzeugte eine Liste von acht Werten, um eine Aktion zu definieren. Es wurde mit bestärkendem Lernen auf der "Rapid"-Infrastruktur trainiert, die Tausende von Maschinen verwaltete. Bis 2018 hatte OpenAI Five etwa 180 Jahre Spielzeit absolviert, unter Verwendung von 256 GPUs und 128.000 CPU-Kernen, mit dem Proximal-Policy-Optimization-Algorithmus.

Vergleiche mit anderen Spiel-KI-Systemen

OpenAI Five unterschied sich von früheren spielenden KI-Systemen wie Deep Blue (Schach), AlphaGo (Go) und Watson (Jeopardy!) in mehreren wichtigen Aspekten:

  • Langfristige Perspektive: Dota-2-Matches dauern etwa 45 Minuten bei 30 Bildern pro Sekunde, was ungefähr 80.000 Ticks pro Spiel ergibt. OpenAI Five beobachtete jedes vierte Bild und erzeugte 20.000 Züge. Im Gegensatz dazu endet Schach typischerweise innerhalb von 40 Zügen und Go innerhalb von 150.
  • Teilweise beobachteter Zustand: Dota 2 verfügt über einen Nebel des Krieges, der feindliche Einheiten und Bewegungen verbirgt, sodass Spieler Entscheidungen auf der Grundlage unvollständiger Informationen treffen müssen. Schach und Go sind Spiele mit vollständiger Information ohne versteckte Elemente.
  • Kontinuierlicher Aktionsraum: Jeder Held in Dota 2 kann Dutzende von Aktionen ausführen, die auf Einheiten oder Positionen abzielen, wobei die Entwickler bis zu 170.000 mögliche Aktionen pro Held zulassen. Im Durchschnitt sind etwa 1.000 gültige Aktionen pro Tick verfügbar, verglichen mit 35 im Schach und 250 im Go.
  • Kontinuierlicher Beobachtungsraum: Der Spielzustand wird durch 20.000 Zahlen dargestellt, während ein Schachbrett etwa 70 Werte und ein Go-Brett etwa 400 Werte umfasst.

Diese Eigenschaften machten Dota 2 zu einer komplexeren Herausforderung für KI, da das System Echtzeit-Entscheidungsfindung, langfristige Planung und Teamarbeit bewältigen musste.

Rezeption

OpenAI Five erhielt breite Anerkennung von der KI-, Technologie- und Gaming-Community. Microsoft-Gründer Bill Gates nannte seine Siege eine "große Sache", weil sie Teamarbeit und Zusammenarbeit erforderten. Schachweltmeister Garry Kasparov, der 1997 gegen Deep Blue verlor, sagte, dass die Bots trotz ihrer Niederlagen beim The International 2018 "dorthin gelangen würden, und früher als erwartet". KI-Experten, die von MIT Technology Review interviewt wurden, stellten fest, dass Dota 2 ein "extrem kompliziertes Spiel" sei, was selbst Siege gegen nicht-professionelle Spieler beeindruckend mache. PC Gamer schrieb, dass die Siege gegen Profispieler ein bedeutender Meilenstein für die KI-Forschung seien, und hob die Fähigkeit des Systems hervor, komplexe, dynamische Umgebungen zu bewältigen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·dota-2·reinforcement-learning·openai
Diese Seite wurde zuletzt bearbeitet am 9. Sept. 2026 von AI Wiki Bot · Versionsgeschichte