# AI击溃Stratego四冠王 训练成本仅8000美元
**时间:** 2026-10-01(Nature 论文 2026-09-30 上线)
**地点:** 美国匹兹堡(卡内基梅隆大学)— Nature 在线发表
**人物:**
- Pim Niemeijer — 四届 Stratego 世界冠军、15 届荷兰全国冠军,超 600 周世界第一
- Samuel Sokota — 卡内基梅隆大学,第一作者
- 联合团队 — 卡内基梅隆、NYU、斯坦福、MIT
- 对照系统 — DeepMind DeepNash(前一代最强 Stratego AI)
**事件详情:**
由卡内基梅隆、纽约大学、斯坦福和 MIT 联合开发的 Ataraxos 系统,以 15 胜 1 负 4 平的战绩击败四届 Stratego 世界冠军 Pim Niemeijer,有效胜率达 85%,为高水平人类对局前所未见。
Stratego(陆军棋)是最后几个对人类仍有优势的棋盘游戏之一——双方开局将 40 枚棋子面朝下秘密放置,可能的摆法超过 10^33。这种"不完全信息博弈"长期让传统强化学习和搜索方法失效,也是 DeepMind DeepNash 此前未能稳定击败顶尖人类棋手的原因。
Ataraxos 的训练成本仅约 8000 美元,使用 16 张 NVIDIA H100 GPU 训练一周加 4 天。与 DeepMind DeepNash 在 1024 个 TPU 节点上训练 2-3 个月(成本 300-450 万美元)相比,计算量仅为其 1/500,自玩局数仅 1/30(1.6 亿 vs 55 亿),训练样本仅 1/100。
技术核心包括两个 Transformer 自玩模块(摆棋 + 走棋)、一个"信念网络"预测对手隐藏棋子,以及测试时的"动态阻尼自玩"正则化方法。
**影响:**
- 论文方法在 Barrage Stratego 实现首个超人类战绩、Hanabi 全部五难度刷新最佳、并击败斗地主既有最强 AI
- 在 2025 Stratego 世界锦标赛表演赛中 40 局拿下 38 场,95% 有效胜率
- Nature 论文显示不完全信息博弈已不再阻碍强化学习,金融、军事、外交等高不确定性领域或迎来突破
**总结:**
DeepMind 用百万美元、千人月都没稳定攻下的 Stratego,被 CMU/NYU/斯坦福/MIT 联合团队以 8000 美元训练成本攻破。AI 在所有主流棋盘游戏上对人类已无悬念,下一步战场正转向金融、军事和外交等不完全信息真实场景。
**参考来源:**
1. Nature 论文原文:https://www.nature.com/articles/s41586-026-11036-y
2. The Decoder 详细报道:https://the-decoder.com/ai-beats-strategos-greatest-player-ending-one-of-the-last-human-strongholds-in-board-games/
3. AI Weekly 摘要:https://aiweekly.co/alerts/ataraxos-beats-stratego-world-champion-on-a-few-thousand-dollar-budget
4. Ataraxos 官方网站(对局档案):https://ataraxosai.github.io/
5. Digg 报道:https://digg.com/ai/yd997lbl
6. GitHub 开源代码:https://github.com/AtaraxosAI/stratego
7. 原始 ArXiv 论文:https://arxiv.org/abs/2511.07312







