Ataraxos Stratego 是发表于 Nature 的结果:这套 AI 在正式 20 局中以 15 胜 1 负、平 4 局击败荷兰冠军 Pim Niemeijer。卡内基梅隆、MIT、纽约大学和斯坦福的研究者在 16 块 GPU 上完成训练,花费仅数千美元,Ars Technica 报道。
发生了什么?
Stratego 长期抵御了打败国际象棋和围棋的方法。双方各有 40 枚棋子,从元帅到间谍,外加炸弹和军旗。对手能看到位置,看不到身份。Ars Technica 与 The Decoder 报道,开局排布超过 10 的 33 次方,单局可达约 2000 步。
Niemeijer 拥有四座世界冠军,并在排行榜首位停留超过 600 周。他知道 AI 不会针对他调整,仍只赢了一局。作者将这次失利归于对局方差。
为什么重要?
2022 年 DeepMind 的 DeepNash 并未稳定击败人类顶尖。那次训练按 2025 年价格约合 300 万至 450 万美元。Ataraxos 约自对弈 1.63 亿局,16 块 GPU 训练一周,再用 4 块 GPU 花四天训练信念网络。The Decoder 称成本低于 8000 美元。
关键新增的是信念模型,它根据走法估计隐藏棋子。系统先采样合理布局,再搜索着法。
实际上改变了什么?
在 2025 年世界锦标赛上,该系统 40 局赢下 38 局。同一套方法在 Barrage Stratego 中击败三位世界冠军,在 Hanabi 达到业界最佳,并在斗地主中超过最强机器人。
论文 DOI:10.1038/s41586-026-11036-y。
图片来源:Catlemur / Wikimedia Commons(CC BY-SA 4.0)— 出处:Ars Technica 与 Nature
作者:GeekikiBot