Une équipe de chercheurs américains a franchi un cap dans les jeux à information cachée. Leur IA Ataraxos a battu Pim Niemeijer, joueur de Stratego le plus titré selon l’étude, avec 15 victoires, une défaite et quatre matchs nuls en 20 parties.
Les résultats ont été publiés le 30 septembre 2026 dans la revue Nature par des chercheurs de Carnegie Mellon University, du MIT, de New York University et de Stanford University. Au-delà du score, leur travail montre qu’une IA peut atteindre un niveau supérieur aux meilleurs humains dans un jeu où une grande partie des informations reste volontairement cachée.
- Ataraxos, une IA, a battu le champion de Stratego Pim Niemeijer : 15 victoires sur 20 parties.
- L'IA combine apprentissage par renforcement et planification probabiliste pour jouer avec des informations cachées.
- Ataraxos a été entraînée pour quelques milliers de dollars, bien moins que les projets précédents.
Ataraxos bat Pim Niemeijer sur 20 parties
Le Stratego oppose deux joueurs disposant chacun de 40 pièces. Leur position est visible, mais leur identité reste inconnue de l’adversaire jusqu’à certains affrontements. Le joueur doit donc raisonner à partir d’informations incomplètes, anticiper les intentions adverses et parfois bluffer.
Cette caractéristique avait résisté aux méthodes qui ont permis aux machines de dominer des jeux comme les échecs ou le go. Selon l’étude publiée dans Nature, il existe plus de 1033 configurations initiales possibles des pièces lorsque l’on tient compte de cette information cachée.
Face à Pim Niemeijer, présenté par les chercheurs comme le joueur le plus décoré de l’histoire du Stratego, Ataraxos a remporté 15 parties sur 20, contre une victoire humaine et quatre matchs nuls. L’équipe estime qu’il s’agit du premier résultat démontrant un niveau surhumain au Stratego classique.
Une autre évaluation a eu lieu lors du championnat du monde de Stratego 2025, organisé du 1er au 3 août. Des participants ont pu affronter le programme : d’après l’article scientifique, Ataraxos a enregistré 38 victoires et deux défaites en 40 parties.
Ataraxos a été entraîné pour quelques milliers de dollars, soit plusieurs ordres de grandeur de moins que les précédents grands projets consacrés au Stratego.
Comment l’IA parvient à jouer avec des pièces cachées

Ataraxos commence par apprendre en jouant contre lui-même grâce à l’apprentissage par renforcement. Cette phase produit une stratégie générale, mais elle ne suffit pas à résoudre le principal problème du Stratego : l’IA ignore elle aussi l’identité d’une grande partie des pièces adverses.
Les chercheurs lui ont donc ajouté une phase de planification au moment de prendre une décision. Un modèle génératif attribue des probabilités aux différentes identités possibles des pièces cachées en fonction de la partie déjà jouée. Ataraxos peut alors examiner plusieurs situations plausibles plutôt que d’essayer de parcourir toutes les configurations théoriquement possibles.
Le MIT explique cette méthode comme une combinaison entre une stratégie apprise par auto-entraînement et une planification effectuée avant de jouer chaque coup. Le système tente ainsi de déterminer quels états cachés du plateau sont les plus vraisemblables avant d’évaluer ses options.
Un entraînement beaucoup moins coûteux que les précédentes tentatives
L’autre résultat notable concerne les ressources nécessaires. Les auteurs indiquent qu’Ataraxos a été entraîné pour quelques milliers de dollars, soit plusieurs ordres de grandeur de moins que les précédents grands projets consacrés au Stratego.
Le MIT précise également qu’Ataraxos atteint une force de jeu supérieure à DeepNash, le système présenté par Google DeepMind en 2022, tout en utilisant moins d’un centième des exemples d’entraînement et moins d’un trentième des parties d’auto-entraînement. DeepNash avait obtenu d’excellents résultats en ligne, mais n’avait pas démontré une supériorité sur les meilleurs joueurs humains lors d’une confrontation comparable.
Une avancée qui dépasse le seul Stratego
Les chercheurs ont appliqué les mêmes principes à plusieurs autres jeux comportant des informations cachées. Ils rapportent notamment des résultats de premier plan sur Barrage Stratego, Hanabi et le jeu de cartes chinois dou dizhu. Cette diversité est importante : l’objectif scientifique consiste moins à fabriquer un programme spécialisé dans un jeu qu’à améliorer la prise de décision lorsque certaines informations sont inconnues.
Les applications concrètes restent toutefois au stade de la recherche. Les auteurs évoquent notamment les négociations, la cybersécurité ou d’autres situations de décision sous incertitude, mais l’étude ne démontre pas qu’Ataraxos puisse aujourd’hui résoudre directement ces problèmes réels. Les règles d’un jeu sont fixes et son objectif clairement défini, contrairement à la plupart des décisions humaines.
Les chercheurs reconnaissent aussi une limite importante : Ataraxos ne sait pas encore expliquer de manière satisfaisante pourquoi il choisit une stratégie. Leur prochaine étape consiste notamment à rendre ses décisions plus interprétables et auditables. Pour l’instant, le résultat établi est plus précis : une IA entraînée avec des moyens relativement modestes a dépassé l’un des meilleurs joueurs humains dans l’un des grands jeux où l’information cachée compliquait encore fortement la tâche des machines.
Questions fréquentes
Comment Ataraxos parvient-elle à jouer efficacement sans connaître l'identité des pièces adverses ?
Un modèle génératif attribue des probabilités aux différentes identités possibles des pièces cachées en fonction de la partie en cours. L’IA examine ensuite plusieurs situations plausibles plutôt que toutes les configurations théoriquement possibles, combinant une stratégie apprise par auto-entraînement et une planification avant chaque coup.
Pourquoi les résultats d'Ataraxos contre Pim Niemeijer constituent-ils une avancée majeure ?
DeepNash, le système précédent de Google DeepMind, avait obtenu d’excellents résultats en ligne mais n’avait pas démontré une supériorité sur les meilleurs joueurs humains lors d’une confrontation comparable. Ataraxos est le premier résultat démontrant un niveau surhumain au Stratego classique face à un champion reconnu.
Les capacités d'Ataraxos s'appliquent-elles déjà aux problèmes réels mentionnés (négociations, cybersécurité) ?
Non. Les auteurs évoquent ces applications potentielles, mais l’étude ne démontre pas qu’Ataraxos puisse aujourd’hui résoudre directement ces problèmes réels, car les règles des jeux sont fixes et l’objectif clairement défini, contrairement à la plupart des décisions humaines.

