搜索会放大自我欺骗:Stratego 论文揭示 AI 被自身预测误导

bravo_abad · x · 2026-10-01

这条帖子转述 Sokota 等人的研究:AI 在选择下一个实验或行动时,可能因为自己的模型高估某候选方案的表现而被误导,而搜索更多可能性反而会放大这种错误。

论文以双陆棋类游戏 Stratego 为例——双方棋子身份初始隐藏。研究者的 AI 用 transformer 网络通过自博弈强化学习训练;行动前它会用自己学到的策略模拟对手反应来推演后续局面,但模拟中看起来好的着法,遇到打法不同的真实对手可能失效。

对策是限制模拟偏离已训练策略的幅度。加上这个保护措施后,搜索才真正提升了 AI 的表现。核心洞见:搜索的收益取决于模拟所依赖的策略质量,模型自身的偏差会让「多想几步」变成系统性自我强化错误。

所属事件:研究称搜索会放大 AI 自我欺骗风险(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →