Ataraxos: KI schlägt Stratego-Legende Pim Niemeijer 15-1

Ataraxos: KI schlägt Stratego-Legende Pim Niemeijer 15-1

Stratego war eines der wenigen großen Wettkampf-Brettspiele, in denen Menschen den Maschinen noch überlegen waren. Damit könnte es jetzt vorbei sein. Ein Forschungsteam der Carnegie Mellon University, der New York University, der Stanford University und des MIT hat Ataraxos entwickelt, eine Stratego-KI, die den erfolgreichsten Spieler der Spielgeschichte deutlich besiegt hat. Das Training kostete nach Angaben des Teams weniger als 8.000 Dollar.

Die Arbeit ist in Nature erschienen. Nach Kenntnis der Autoren ist Ataraxos die erste KI, die in Stratego übermenschliches Niveau erreicht.

Ein einseitiges Duell gegen den Besten

In einer offiziellen Serie über 20 Partien trat Ataraxos gegen den Niederländer Pim Niemeijer an. Am Ende standen für die KI 15 Siege, vier Remis und eine Niederlage.

Niemeijers Bilanz ist unerreicht. Er hat vier Weltmeistertitel, 15 niederländische Meistertitel und zwei Online-Weltmeisterschaften gewonnen. Außerdem stand er mehr als 600 Wochen auf Platz eins der Weltrangliste. George Franka, der als einziger Spieler seit 1997 an jeder Weltmeisterschaft teilgenommen hat, nennt ihn "den besten Stratego-Spieler aller Zeiten".

Die Serie erstreckte sich über drei Wochen, um Ermüdung zu vermeiden und Niemeijer Zeit zur Vorbereitung zu geben. Für seine Teilnahme erhielt er 1.000 Dollar, dazu 100 Dollar pro Sieg und 50 Dollar pro Remis. Er hatte also allen Grund, sein Bestes zu geben. Zudem wusste er, dass sich die KI nicht an seinen Stil anpassen würde.

Wertet man Remis als halben Sieg, kommt Ataraxos auf eine effektive Siegquote von 85 Prozent. Die Autoren bezeichnen das auf höchstem Niveau als beispiellos. Max Roelofs, dreimaliger Vizeweltmeister, weist darauf hin, dass die Abstände zwischen Spitzenspielern normalerweise hauchdünn sind, weil das Spiel zum Eingehen von Risiken zwingt. Die KI spielte zudem mit einem strukturellen Nachteil: Niemeijer konnte sich von Partie zu Partie auf sie einstellen, sie sich aber nicht auf ihn. Der dreimalige Weltmeister Vincent de Boer hält das laut der Studie für ein erhebliches Handicap.

Bei einem Schaukampf während der Stratego-Weltmeisterschaft 2025 gewann Ataraxos 38 von 40 Partien gegen Turnierspieler. Gegner beschreiben ihren Stil als schwer durchschaubar. Sie blufft auf eine Weise, die Menschen als zu riskant empfinden, verschleppt hartnäckig das Spiel, wenn sie zurückliegt, und scheint bei der Aufstellung ihrer Figuren fast unheimlich viel Glück zu haben.

Warum Stratego so schwierig war

Jede Seite stellt 40 Figuren verdeckt auf. Die Studie kommt auf mehr als 10^33 mögliche Aufstellungen. Erstautor Samuel Sokota erklärte auf X, dass bei Spielen mit verdeckten Informationen der Wert eines Zuges nicht nur davon abhängt, was danach kommt, sondern auch davon, was vorher und während der Entscheidung passiert ist.

Methoden aus der Poker-KI umgingen dieses Problem, allerdings nur, solange die verdeckten Informationen überschaubar blieben. Texas Hold'em kennt gerade einmal 1.326 mögliche Starthände, und der Rechenaufwand dieser Methoden wächst mit der Menge an verdeckten Informationen.

Ein Bruchteil des DeepMind-Budgets

DeepMind hatte es zuvor mit DeepNash versucht, kam damit aber nicht über das Niveau menschlicher Spitzenspieler hinaus. DeepNash wurde zwei bis drei Monate lang auf 1.024 TPU-Knoten trainiert. Die Ataraxos-Autoren schätzen, dass das zu Preisen von 2025 zwischen 3 Millionen und 4,5 Millionen Dollar kosten würde. Bei der Weltmeisterschaft 2023 gewann DeepNash 19 von 28 Partien, verlor aber gegen die meisten Spitzenspieler, darunter Niemeijer.

Ataraxos brauchte eine Woche auf 16 Nvidia-H100-GPUs, dazu vier Tage auf vier GPUs für sein Belief-Netzwerk. Die Forscher beziffern das auf etwa 1/500 der Rechenkosten, 1/30 der Selbstspiel-Partien und 1/100 der Trainingsbeispiele. Sie führen das auf einen eigens entwickelten GPU-Simulator und eine deutlich höhere Dateneffizienz zurück.

Zu einem direkten Duell kam es nie. Das Team bot an, die Infrastruktur dafür aufzubauen, doch DeepMind teilte mit, dass der DeepNash-Code nicht mehr funktioniert.

Wie die KI lernt

Ataraxos kommt ohne menschliche Daten aus. Sie lernt ausschließlich, indem sie gegen sich selbst spielt. Entscheidend ist die Regularisierung: Eine zusätzliche Bedingung im Training drängt die KI dazu, ihre Aufstellungen und Züge zu variieren, statt sich zu früh auf eine feste Strategie festzulegen. Wer in Stratego berechenbar spielt, wird ausgenutzt.

Dieser Druck lässt mit der Zeit nach, und die Schrittweiten werden entsprechend kleiner. Anfangs variiert die KI stark und lernt in großen Sprüngen. Später nimmt sie nur noch kleine Korrekturen vor. Die Autoren vergleichen die Regularisierung mit einem Energievorrat: Wer ihn zu schnell verbraucht, bringt das Lernen zum Stillstand.

Ein Belief-Netzwerk sagt die verdeckten Figuren des Gegners voraus. Vor jedem Zug spielt Ataraxos mögliche Spielstände durch, testet Zugkandidaten und führt für diese Entscheidung einen zusätzlichen Lernschritt aus.

Mehr als ein Spiel

Dieselbe Methode gewann vier Serien über je 50 Partien in Barrage Stratego gegen drei der vier bestplatzierten Spieler. Im Kartenspiel Hanabi stellte sie in jeder Variante Rekorde auf, und im chinesischen Kartenspiel Dou dizhu schlug sie PerfectDou und DouZero.

Die Autoren argumentieren, dass große Mengen verdeckter Informationen für bestärkendes Lernen und Suchverfahren kein Hindernis mehr sind, sofern schnelle und genaue Simulatoren zur Verfügung stehen. Als Beispiele nennen sie Finanzmärkte, militärische Konflikte und Verhandlungen. Eine Grenze bleibt: Weil die Suche nur einen einzigen Lernschritt nachbildet, verbessert zusätzliche Rechenzeit die Ergebnisse nicht unbegrenzt. Der Code ist öffentlich verfügbar.

Die Einordnung

Die Schlagzeile ist der Sieg, doch die Kostenangabe könnte wichtiger sein. Ein Universitätsteam hat ein Ergebnis übertroffen, für das ein großes Labor Millionen ausgegeben hat. Das deutet darauf hin, dass ein cleveres Trainingsdesign in manchen Bereichen immer noch mehr bewirken kann als reine Rechenleistung.

Der Sprung zu Märkten oder Verhandlungen ist allerdings größer. Die Autoren knüpfen ihn selbst an eine Bedingung: gute Simulatoren. Damit steht diese Arbeit im Zusammenhang mit dem breiteren Trend zu simulierten Umgebungen, etwa den Weltmodell-Startups, die große Finanzierungsrunden einsammeln. In der realen Welt gibt es nur selten klare Regeln.

Spannend bleibt, ob andere die Ergebnisse mit dem offenen Code nachvollziehen können und ob ein stärkeres Suchverfahren die Rechengrenze aufhebt, auf die die Autoren hinweisen.