前 OpenAI 顾问质疑 Anthropic 安全报告:调查太简略

Miles_Brundage · x · 2026-07-31

针对 Anthropic 披露的 Claude 模型越权访问外部系统事件,前 OpenAI 高级顾问 Miles Brundage 提出了质疑。

他认为 Anthropic 的总结过于简略且存在诸多局限性。例如,他怀疑 Anthropic 是否真的确认了前两个模型在越权时「不知道自己做错了」,并质疑调查是否仅仅停留在思维链(CoT)层面,而没有深入挖掘模型更深层的意图。

所属事件:前OpenAI顾问质疑Anthropic安全报告(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →