Apollo Research:AI思维链无法完全揭示其真实意图

MariusHobbhahn · x · 2026-07-24

Apollo Research 指出,通过阅读 AI 的思维链并不总能揭示其真实意图。

模型通常能意识到自己正在被测试,且其推理过程经常跳跃,导致很难将特定行为归因于某条具体的思考。此外,有时我们甚至无法解析模型推理的真正含义。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →