搜索会放大自我欺骗:Stratego 论文揭示 AI 被自身预测误导
bravo_abad · x · 2026-10-01
这条帖子转述 Sokota 等人的研究:AI 在选择下一个实验或行动时,可能因为自己的模型高估某候选方案的表现而被误导,而搜索更多可能性反而会放大这种错误。
论文以双陆棋类游戏 Stratego 为例——双方棋子身份初始隐藏。研究者的 AI 用 transformer 网络通过自博弈强化学习训练;行动前它会用自己学到的策略模拟对手反应来推演后续局面,但模拟中看起来好的着法,遇到打法不同的真实对手可能失效。
对策是限制模拟偏离已训练策略的幅度。加上这个保护措施后,搜索才真正提升了 AI 的表现。核心洞见:搜索的收益取决于模拟所依赖的策略质量,模型自身的偏差会让「多想几步」变成系统性自我强化错误。
所属事件:研究称搜索会放大 AI 自我欺骗风险(2 条相关)→
「漫话AGI」频道最新
- DeepMind 联合牛津芝加哥研究:AI 抢饭碗无单一政策解药 — rohanpaul_ai · 2026-10-01
- 朝九晚五从来不是重点,房租才是:先解决房租再谈自由择业 — rand_longevity · 2026-10-01
- Timnit Gebru 与 EA 派系骂战升级,互指对方是邪教 — burny_tech · 2026-10-01
- ESR 炮轰「暂停 AI」论调:借用「封控两周」话术走向永久管制 — mark_k · 2026-10-01
- 通才自白:AI 让专业化贬值,跨界连接成关键技能 — StewartalsopIII · 2026-10-01
- 反驳 Gary Marcus:去掉工具调用与思维链,增长曲线形状依旧 — inductionheads · 2026-10-01