L'IA Ataraxos bat la légende du Stratego Pim Niemeijer 15-1

L'IA Ataraxos bat la légende du Stratego Pim Niemeijer 15-1

Le Stratego était l'un des rares grands jeux de plateau compétitifs où l'humain gardait encore l'avantage sur la machine. C'est peut-être terminé. Une équipe de chercheurs de l'université Carnegie Mellon, de l'université de New York, de l'université Stanford et du MIT a mis au point Ataraxos, une IA de Stratego qui a nettement battu le joueur le plus titré de l'histoire du jeu. Selon l'équipe, l'entraînement a coûté moins de 8 000 dollars.

Les travaux sont publiés dans Nature. À la connaissance des auteurs, Ataraxos est la première IA à atteindre un niveau surhumain au Stratego.

Un match à sens unique face au meilleur

Lors d'une série officielle de 20 parties, Ataraxos a affronté le Néerlandais Pim Niemeijer. Score final : 15 victoires, quatre nuls et une défaite pour l'IA.

Le palmarès de Niemeijer est sans équivalent. Il compte quatre titres de champion du monde, 15 titres de champion des Pays-Bas et deux titres de champion du monde en ligne. Il a aussi passé plus de 600 semaines à la première place du classement mondial. George Franka, seul joueur à avoir disputé tous les championnats du monde depuis 1997, le qualifie de "meilleur joueur de Stratego de tous les temps".

La série s'est étalée sur trois semaines pour éviter la fatigue et laisser à Niemeijer le temps de se préparer. Il a touché 1 000 dollars pour sa participation, plus 100 dollars par victoire et 50 dollars par nul, ce qui l'incitait à donner le meilleur de lui-même. Il savait aussi que l'IA ne s'adapterait pas à son style.

En comptant les nuls comme des demi-victoires, Ataraxos atteint un taux de victoire effectif de 85 %. Les auteurs parlent d'un résultat sans précédent au plus haut niveau. Max Roelofs, trois fois vice-champion du monde, souligne que les écarts entre joueurs d'élite sont d'ordinaire infimes, car le jeu oblige à prendre des risques. L'IA jouait en outre avec un handicap structurel : Niemeijer pouvait s'adapter à elle d'une partie à l'autre, mais elle ne pouvait pas s'adapter à lui. Vincent de Boer, triple champion du monde, y voit un désavantage majeur, selon l'article.

Lors d'une exhibition en marge du championnat du monde de Stratego 2025, Ataraxos a remporté 38 parties sur 40 contre des joueurs de tournoi. Ses adversaires décrivent un style difficile à déchiffrer. Elle bluffe d'une manière que les humains jugent trop risquée, temporise obstinément quand elle est menée et semble avoir une chance presque troublante dans le placement de ses pièces.

Pourquoi le Stratego résistait

Chaque camp place 40 pièces face cachée. L'article recense plus de 10^33 dispositions initiales possibles. Le premier auteur, Samuel Sokota, a expliqué sur X que dans les jeux à information cachée, la valeur d'un coup ne dépend pas seulement de la suite, mais aussi de ce qui s'est passé avant et pendant la décision.

Les méthodes issues des IA de poker contournaient ce problème, mais seulement lorsque l'information cachée restait limitée. Le Texas Hold'em ne compte que 1 326 mains de départ possibles, et la puissance de calcul nécessaire à ces méthodes croît avec la quantité d'information cachée.

Une fraction du budget de DeepMind

DeepMind s'y était déjà essayé avec DeepNash, qui n'a pas dépassé le niveau des meilleurs humains. DeepNash a été entraîné sur 1 024 noeuds TPU pendant deux à trois mois. Les auteurs d'Ataraxos estiment que cela coûterait entre 3 et 4,5 millions de dollars aux prix de 2025. Au championnat du monde 2023, DeepNash avait gagné 19 parties sur 28, mais s'était incliné face à la plupart des meilleurs joueurs, dont Niemeijer.

Ataraxos n'a eu besoin que d'une semaine sur 16 GPU Nvidia H100, plus quatre jours sur quatre GPU pour son réseau de croyances. Les chercheurs évaluent cela à environ 1/500e du coût de calcul, 1/30e des parties en auto-apprentissage et 1/100e des exemples d'entraînement. Ils l'attribuent à un simulateur GPU développé sur mesure et à une efficacité d'échantillonnage bien supérieure.

Aucun affrontement direct n'a eu lieu. L'équipe a proposé de mettre en place l'infrastructure, mais DeepMind a répondu que le code de DeepNash ne fonctionnait plus.

Comment elle apprend

Ataraxos n'utilise aucune donnée humaine. Elle apprend uniquement en jouant contre elle-même. La clé, c'est la régularisation : une contrainte supplémentaire pendant l'entraînement pousse l'IA à varier ses dispositions et ses coups au lieu de se figer trop tôt sur une stratégie fixe. Au Stratego, les joueurs prévisibles se font exploiter.

Cette pression s'allège avec le temps, et la taille des pas diminue en parallèle. Au début, l'IA varie beaucoup et apprend par grands bonds. Ensuite, elle procède à de petites corrections. Les auteurs comparent la régularisation à une réserve d'énergie : si on la brûle trop vite, l'apprentissage s'enlise.

Un réseau de croyances prédit les pièces cachées de l'adversaire. Avant chaque coup, Ataraxos échantillonne des états de jeu possibles, teste des coups candidats et effectue une étape d'apprentissage supplémentaire pour cette décision.

Au-delà d'un seul jeu

La même méthode a remporté quatre séries de 50 parties de Barrage Stratego contre trois des quatre joueurs les mieux classés. Elle a établi des records dans toutes les variantes du jeu de cartes Hanabi et battu PerfectDou et DouZero au jeu de cartes chinois Dou dizhu.

Les auteurs estiment que de grandes quantités d'information cachée ne sont plus un obstacle pour l'apprentissage par renforcement et la recherche, à condition de disposer de simulateurs rapides et précis. Ils citent en exemple les marchés financiers, les conflits militaires et les négociations. Une limite demeure : comme la recherche ne reproduit qu'une seule étape d'apprentissage, ajouter du temps de calcul n'améliore pas indéfiniment les résultats. Le code est public.

Notre analyse

La victoire fait les gros titres, mais le chiffre du coût pourrait compter davantage. Une équipe universitaire a dépassé un résultat dans lequel un grand laboratoire avait investi des millions, ce qui laisse penser que, dans certains domaines, une conception astucieuse de l'entraînement peut encore l'emporter sur la puissance de calcul brute.

Le saut vers les marchés ou les négociations est d'une autre ampleur. Les auteurs eux-mêmes le soumettent à une condition : de bons simulateurs. Ces travaux rejoignent ainsi l'essor plus large des environnements simulés, à l'image des startups des modèles du monde qui attirent d'importantes levées de fonds. Or, les situations du monde réel obéissent rarement à des règles claires.

Reste à voir si d'autres parviendront à reproduire ces résultats avec le code ouvert, et si une méthode de recherche plus puissante permettra de lever le plafond de calcul signalé par les auteurs.