La IA Ataraxos vence 15-1 a Pim Niemeijer en Stratego
El Stratego era uno de los pocos grandes juegos de tablero competitivos en los que los humanos aún aventajaban a las máquinas. Puede que eso se haya acabado. Un equipo de investigadores de la Universidad Carnegie Mellon, la Universidad de Nueva York, la Universidad de Stanford y el MIT ha creado Ataraxos, una IA de Stratego que ha derrotado con claridad al jugador más laureado de la historia del juego. Según el equipo, el entrenamiento costó menos de 8.000 dólares.
El trabajo se ha publicado en Nature. Hasta donde saben los autores, Ataraxos es la primera IA que alcanza un nivel sobrehumano en Stratego.
Un duelo sin color contra el mejor
En una serie oficial de 20 partidas, Ataraxos se enfrentó al neerlandés Pim Niemeijer. El resultado final fue de 15 victorias, cuatro tablas y una derrota para la IA.
El palmarés de Niemeijer no tiene rival. Suma cuatro campeonatos del mundo, 15 títulos nacionales de los Países Bajos y dos campeonatos del mundo en línea. Además, pasó más de 600 semanas como número uno del ranking mundial. George Franka, el único jugador que ha disputado todos los campeonatos del mundo desde 1997, lo considera "el mejor jugador de Stratego de todos los tiempos".
La serie se repartió a lo largo de tres semanas para evitar el cansancio y dar a Niemeijer tiempo para prepararse. Cobró 1.000 dólares por participar, más 100 dólares por victoria y 50 por empate, así que tenía motivos para dar lo mejor de sí. También sabía que la IA no se adaptaría a su estilo.
Si se cuentan las tablas como media victoria, Ataraxos logró un porcentaje efectivo de victorias del 85 %. Los autores lo califican de inédito en la élite. Max Roelofs, tres veces subcampeón del mundo, señala que las diferencias entre los mejores jugadores suelen ser mínimas porque el juego obliga a asumir riesgos. La IA, además, jugó con una desventaja estructural: Niemeijer podía ajustarse a ella de una partida a otra, pero ella no podía ajustarse a él. Según el artículo, el tricampeón del mundo Vincent de Boer lo considera un hándicap importante.
En una exhibición durante el Campeonato del Mundo de Stratego de 2025, Ataraxos ganó 38 de 40 partidas contra jugadores de torneo. Sus rivales describen su estilo como difícil de descifrar. Farolea de maneras que los humanos ven demasiado arriesgadas, se atrinchera con terquedad cuando va por detrás y parece tener una suerte casi inquietante con la colocación de las piezas.
Por qué el Stratego era tan difícil
Cada bando coloca 40 piezas boca abajo. El artículo cuenta más de 10^33 despliegues iniciales posibles. El primer autor, Samuel Sokota, explicó en X que, en los juegos con información oculta, el valor de un movimiento no depende solo de lo que viene después, sino también de lo que ocurrió antes y durante la decisión.
Los métodos de la IA de póquer sorteaban este problema, pero solo cuando la información oculta era limitada. El Texas Hold'em tiene apenas 1.326 manos iniciales posibles, y la capacidad de cálculo que necesitan esos métodos crece con la cantidad de información oculta.
Una fracción del presupuesto de DeepMind
DeepMind ya lo intentó con DeepNash, que no pasó del nivel de los mejores humanos. DeepNash se entrenó en 1.024 nodos TPU durante dos o tres meses. Los autores de Ataraxos calculan que eso costaría entre 3 y 4,5 millones de dólares a precios de 2025. En el campeonato del mundo de 2023, DeepNash ganó 19 de 28 partidas, pero perdió contra la mayoría de los mejores jugadores, Niemeijer incluido.
Ataraxos necesitó una semana en 16 GPU H100 de Nvidia, más cuatro días en cuatro GPU para su red de creencias. Los investigadores lo cifran en aproximadamente 1/500 del coste de cálculo, 1/30 de las partidas contra sí misma y 1/100 de los ejemplos de entrenamiento. Lo atribuyen a un simulador propio en GPU y a una eficiencia muestral muy superior.
Nunca llegó a celebrarse un enfrentamiento directo. El equipo se ofreció a montar la infraestructura, pero DeepMind respondió que el código de DeepNash ya no funciona.
Cómo aprende
Ataraxos no utiliza datos humanos. Aprende únicamente jugando contra sí misma. La clave está en la regularización: una condición adicional durante el entrenamiento empuja a la IA a variar sus despliegues y movimientos en lugar de aferrarse demasiado pronto a una estrategia fija. En Stratego, a los jugadores previsibles se les acaba explotando.
Esa presión se relaja con el tiempo, y el tamaño de los pasos se reduce con ella. Al principio, la IA varía mucho y aprende a grandes saltos. Más adelante, hace pequeñas correcciones. Los autores comparan la regularización con una reserva de energía: si se gasta demasiado deprisa, el aprendizaje se estanca.
Una red de creencias predice las piezas ocultas del rival. Antes de cada movimiento, Ataraxos muestrea posibles estados de la partida, prueba movimientos candidatos y ejecuta un paso de aprendizaje adicional para esa decisión.
Más allá de un solo juego
El mismo método ganó cuatro series de 50 partidas de Barrage Stratego contra tres de los cuatro primeros del ranking. Batió récords en todas las variantes del juego de cartas Hanabi y derrotó a PerfectDou y DouZero en el juego de cartas chino Dou dizhu.
Los autores sostienen que las grandes cantidades de información oculta ya no son un obstáculo para el aprendizaje por refuerzo y la búsqueda, siempre que existan simuladores rápidos y precisos. Citan como ejemplos los mercados financieros, los conflictos militares y las negociaciones. Queda un límite: como la búsqueda imita un único paso de aprendizaje, dedicarle más tiempo de cálculo no mejora los resultados de forma indefinida. El código es público.
La visión de conjunto
El titular es la victoria, pero la cifra del coste puede pesar más. Un equipo universitario ha superado un resultado en el que un gran laboratorio se gastó millones, lo que sugiere que, en algunos ámbitos, un diseño de entrenamiento ingenioso todavía puede imponerse a la potencia de cálculo bruta.
El salto a los mercados o las negociaciones es mayor. Los propios autores lo supeditan a una condición: buenos simuladores. Eso conecta este trabajo con el impulso más amplio hacia los entornos simulados, como el de las startups de modelos del mundo que están atrayendo grandes rondas de financiación. Los escenarios del mundo real rara vez vienen con reglas limpias.
Merece la pena estar atentos a si otros reproducen los resultados con el código abierto y a si un método de búsqueda más potente elimina el techo de cálculo que señalan los autores.
