Astra 无 CoT 推理大幅领先,隐蔽推理能力引发安全担忧

JeffLadish · x · 2026-09-11

Jeff Ladish 引用评测数据指出,Astra 在无思维链(no-CoT)推理任务上的胜算比次优模型(Fable 5.1)高 8.6 倍,单个前向传播可完成 7.2 步串行算术(次优为 4.1)。

他解释了为何这值得警惕:CoT 之所以是监控模型的有效手段,是因为前向传播内的串行计算深度受限,模型不得不把推理「写在明处」;无 CoT 推理能力越强,模型可进行的隐蔽推理就越多,CoT 的可监控性压力随之下降。Neel Nanda 用自己的私有 benchmark 复现了 AI 安全研究所的发现,印证 Astra 更难被监控。

所属事件:Astra 无思维链推理暴涨引安全担忧(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →