Astra 无思维链仍展现强推理,隐蔽推理风险引发安全担忧

JeffLadish · x · 2026-09-11

安全研究者 Jeff Ladish 表达担忧:OpenAI 的 GPT 系列之外的 Astra 在没有显式思维链的情况下推理能力出现大幅跃升。Neel Nanda 用自己的私有基准复现了 AISecurity Institute(AISI)的发现,证实了这一能力跳变。

Ladish 指出,这意味着模型进行隐蔽推理(covert reasoning)的空间被大幅放大——外部无法通过思维链监控模型内部在想什么,模型监控的可观测性进一步降低。

所属事件:Astra 无思维链推理暴增,隐蔽推理引安全担忧(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →