- Ataraxos, desarrollado por MIT, Carnegie Mellon, Universidad de Nueva York y Stanford, se convierte en la primera IA que supera a los mejores jugadores de Stratego.
- Combina autoaprendizaje por refuerzo con planificación probabilística para decidir sin ver las piezas del rival.
- Logra un 15-1-4 ante el campeón mundial y un 39-2 en el Mundial, además de rendir por encima de humanos en Barrage Stratego, Hanabi y Dou dizhu.
- Podría aplicarse a negociaciones, ciberseguridad o estrategia militar, aunque aún necesita explicar sus decisiones.

Ataraxos, un sistema de inteligencia artificial creado por equipos del MIT, Carnegie Mellon, la Universidad de Nueva York y Stanford, se ha convertido en el primer modelo capaz de superar a los mejores jugadores humanos de Stratego. El trabajo se ha publicado en la revista Nature y supone un paso relevante en un terreno donde la máquina no ve todas las piezas del rival.
La gesta no se queda en el tablero. Sus responsables sostienen que decidir con datos incompletos es una habilidad aprovechable en negociaciones, ciberseguridad, maniobras militares o mercados financieros. A diferencia de intentos previos, este sistema destaca por su eficiencia y por haber ganado al mejor jugador mundial, el neerlandés Pim Niemeijer, con un margen muy amplio.
Un juego donde casi todo está oculto
Stratego se parece a un ajedrez militar, pero con un ingrediente incómodo: cada participante desconoce la identidad de las fichas rivales. En cada lado se despliegan 40 piezas y el objetivo es capturar la bandera contraria. Solo cuando dos piezas chocan se revela qué eran, y entonces se retira la de menor rango.
Esa niebla permanente dispara las posibilidades. Los cálculos citados por los investigadores hablan de más de 10 elevado a 66 configuraciones, una cifra muy superior a la del ajedrez. Por eso no basta con calcular jugadas: hay que manejar probabilidades, engaños y suposiciones sobre lo que esconde el contrario.
Aprendizaje por refuerzo y cálculo en el momento
Para entrenar a Ataraxos, el equipo recurrió al aprendizaje por refuerzo mediante autoaprendizaje. El modelo disputa partidas contra sí mismo una y otra vez, sin necesidad de ejemplos etiquetados, hasta construir una estrategia sólida. Los algoritmos diseñados para esta fase son mucho más ligeros que los de propuestas anteriores.
El sistema también emplea una planificación en tiempo de decisión. En vez de escoger movimientos a ciegas, estima con probabilidades qué piezas puede tener el rival y evalúa las consecuencias antes de actuar. Ese mecanismo, según los autores, es clave para su rendimiento sobrehumano.
La comparación con DeepNash, de DeepMind, resulta llamativa. Aquel modelo llegó a nivel experto en 2022, pero exigía recursos enormes. Ataraxos habría alcanzado un nivel superior con menos del 1% de los datos de entrenamiento y alrededor del 3% de las partidas de autojuego, además de un coste económico muy inferior.
Resultados ante humanos y en otros juegos
En la serie contra el mejor jugador del mundo, Ataraxos firmó un 15-1-4 en veinte partidas. En el campeonato mundial celebrado a comienzos de agosto de 2025, su registro fue de 39 victorias y 2 derrotas frente a rivales de primer nivel.
La capacidad del modelo no se limita a Stratego. Los investigadores lo adaptaron a Barrage Stratego, Hanabi y Dou dizhu, tres juegos con reglas y formas de cooperación distintas, y en todos ellos obtuvo resultados por encima de los humanos. Eso apunta a una técnica generalizable, no a un truco para un único tablero.
Del tablero a decisiones del mundo real
Muchos problemas cotidianos comparten esa falta de información completa. Un operador financiero no sabe por qué otro está comprando o vendiendo; un mando militar no conoce con exactitud dónde están las fuerzas enemigas; en una negociación comercial, cada parte esconde parte de sus cartas. En esos escenarios, enumerar todas las opciones es inviable.
Los creadores destacan que Ataraxos gestiona el riesgo de una forma poco humana. Si una pieza valiosa queda expuesta, una persona podría precipitarse, mientras que el modelo mantiene la calma y no revela sus intenciones. No reacciona de más ni entrega sus secretos, según explican los responsables del proyecto.
Ahora bien, el sistema sigue siendo en buena medida una caja negra. Los investigadores quieren dotarlo de herramientas de interpretabilidad para que pueda justificar sus decisiones de manera comprensible. Esa cautela cobra sentido si la IA se usa en ámbitos sensibles, donde conviene que la última palabra siga siendo humana.
Ataraxos representa un avance notable porque ha vencido a los mejores en un juego de información oculta, lo ha hecho con un entrenamiento mucho más barato que sus antecesores y ha mostrado resultados sólidos en otras disciplinas. Su posible salto a negociaciones, ciberseguridad o estrategia militar invita a mirarlo con interés, pero también con prudencia: antes de confiar en sus decisiones, habrá que entender cómo las toma.

