AI Ataraxos verslaat Stratego-legende Pim Niemeijer 15-1
Stratego was een van de weinige grote competitieve bordspellen waarin mensen nog de overhand hadden op machines. Dat is nu misschien voorbij. Een onderzoeksteam van Carnegie Mellon University, New York University, Stanford University en MIT heeft Ataraxos gebouwd, een Stratego-AI die de succesvolste speler uit de geschiedenis van het spel overtuigend versloeg. Volgens het team kostte de training minder dan 8.000 dollar.
Het werk is gepubliceerd in Nature. Voor zover de auteurs weten, is Ataraxos de eerste AI die in Stratego een bovenmenselijk niveau haalt.
Een eenzijdige wedstrijd tegen de beste
In een officiele serie van 20 partijen speelde Ataraxos tegen de Nederlandse speler Pim Niemeijer. De eindstand: 15 overwinningen, vier remises en een nederlaag voor de AI.
Niemeijers erelijst is ongeevenaard. Hij heeft vier wereldtitels, 15 Nederlandse titels en twee online wereldtitels op zijn naam staan. Daarnaast stond hij meer dan 600 weken op nummer een van de wereldranglijst. George Franka, de enige speler die sinds 1997 aan elk wereldkampioenschap heeft deelgenomen, noemt hem "de beste Stratego-speler aller tijden."
De serie werd verspreid over drie weken om vermoeidheid te voorkomen en Niemeijer tijd te geven zich voor te bereiden. Hij kreeg 1.000 dollar voor zijn deelname, plus 100 dollar per overwinning en 50 dollar per remise, dus hij had alle reden om zijn beste spel te spelen. Hij wist ook dat de AI zich niet aan zijn stijl zou aanpassen.
Als remises als een halve overwinning worden geteld, kwam Ataraxos uit op een effectief winstpercentage van 85 procent. De auteurs noemen dat ongekend op het hoogste niveau. Max Roelofs, drievoudig nummer twee op het wereldkampioenschap, merkt op dat de verschillen tussen topspelers meestal flinterdun zijn, omdat het spel je dwingt risico's te nemen. De AI speelde bovendien met een structurele handicap: Niemeijer kon zich van partij tot partij op de AI instellen, maar de AI niet op hem. Volgens het artikel ziet drievoudig wereldkampioen Vincent de Boer dat als een groot nadeel.
Tijdens een demonstratie op het Stratego-wereldkampioenschap van 2025 won Ataraxos 38 van de 40 partijen tegen toernooispelers. Tegenstanders omschrijven de speelstijl als moeilijk te doorgronden. De AI bluft op manieren die mensen te riskant vinden, rekt koppig tijd als hij achterstaat en lijkt bij het opstellen van de stukken haast griezelig veel geluk te hebben.
Waarom Stratego zo lastig was
Elke speler zet 40 stukken gedekt neer. Het artikel telt meer dan 10^33 mogelijke opstellingen. Eerste auteur Samuel Sokota legde op X uit dat bij spellen met verborgen informatie de waarde van een zet niet alleen afhangt van wat er daarna gebeurt, maar ook van wat er voor en tijdens de beslissing is gebeurd.
Methoden uit poker-AI omzeilden dat probleem, maar alleen zolang de verborgen informatie beperkt bleef. Texas Hold'em kent slechts 1.326 mogelijke starthanden, en de rekenkracht die die methoden nodig hebben, groeit mee met de hoeveelheid verborgen informatie.
Een fractie van het budget van DeepMind
DeepMind deed eerder al een poging met DeepNash, dat niet verder kwam dan het menselijke topniveau. DeepNash werd twee tot drie maanden getraind op 1.024 TPU-nodes. De auteurs van Ataraxos schatten dat dit tegen prijzen van 2025 tussen de 3 en 4,5 miljoen dollar zou kosten. Op het wereldkampioenschap van 2023 won DeepNash 19 van de 28 partijen, maar verloor het van de meeste topspelers, onder wie Niemeijer.
Ataraxos had een week nodig op 16 Nvidia H100-gpu's, plus vier dagen op vier gpu's voor het belief-netwerk. De onderzoekers komen daarmee uit op ongeveer 1/500e van de rekenkosten, 1/30e van het aantal self-play-partijen en 1/100e van het aantal trainingsvoorbeelden. Ze schrijven dat toe aan een zelfgebouwde gpu-simulator en een veel hogere sample-efficientie.
Een rechtstreeks duel is er nooit gekomen. Het team bood aan de infrastructuur te bouwen, maar DeepMind liet weten dat de code van DeepNash niet meer werkt.
Hoe het leert
Ataraxos gebruikt geen menselijke data. Het leert uitsluitend door tegen zichzelf te spelen. De sleutel is regularisatie: een extra voorwaarde tijdens de training dwingt de AI om zijn opstellingen en zetten te blijven variëren in plaats van te vroeg op een vaste strategie uit te komen. Voorspelbare Stratego-spelers worden namelijk afgestraft.
Die druk neemt in de loop van de tijd af, en de stapgrootte krimpt mee. In het begin varieert de AI sterk en leert het met grote sprongen. Later voert het kleine correcties door. De auteurs vergelijken regularisatie met een energiereserve: wie die te snel opmaakt, ziet het leren stilvallen.
Een belief-netwerk voorspelt de verborgen stukken van de tegenstander. Voor elke zet neemt Ataraxos steekproeven van mogelijke spelsituaties, test het kandidaatzetten en voert het een extra leerstap uit voor die ene beslissing.
Meer dan een spel
Dezelfde methode won vier series van 50 partijen Barrage Stratego tegen drie van de vier hoogst gerangschikte spelers. Ze vestigde records in elke variant van het kaartspel Hanabi en versloeg PerfectDou en DouZero in het Chinese kaartspel Dou dizhu.
Volgens de auteurs vormen grote hoeveelheden verborgen informatie geen obstakel meer voor reinforcement learning en zoekalgoritmen, op voorwaarde dat er snelle en nauwkeurige simulatoren bestaan. Als voorbeelden noemen ze financiele markten, militaire conflicten en onderhandelingen. Een beperking blijft: omdat de zoekmethode maar een enkele leerstap nabootst, levert extra rekentijd niet steeds betere resultaten op. De code is openbaar.
Het grotere plaatje
De overwinning haalt de krantenkoppen, maar het kostenplaatje is misschien belangrijker. Een universitair team overtrof een resultaat waar een groot lab miljoenen in had gestoken. Dat wijst erop dat een slim trainingsontwerp op sommige terreinen nog altijd zwaarder kan wegen dan pure rekenkracht.
De stap naar markten of onderhandelingen is een stuk groter. De auteurs koppelen die zelf aan een voorwaarde: goede simulatoren. Daarmee sluit dit werk aan bij de bredere opmars van gesimuleerde omgevingen, zoals de world model-startups die grote financieringsrondes binnenhalen. In de echte wereld zijn de regels zelden zo helder.
Het is de moeite waard om te volgen of anderen de resultaten met de open code kunnen reproduceren, en of een sterkere zoekmethode het rekenplafond wegneemt waar de auteurs op wijzen.
