Astra 无思维链仍展现强推理,隐蔽推理风险引发安全担忧
JeffLadish · x · 2026-09-11
安全研究者 Jeff Ladish 表达担忧:OpenAI 的 GPT 系列之外的 Astra 在没有显式思维链的情况下推理能力出现大幅跃升。Neel Nanda 用自己的私有基准复现了 AISecurity Institute(AISI)的发现,证实了这一能力跳变。
Ladish 指出,这意味着模型进行隐蔽推理(covert reasoning)的空间被大幅放大——外部无法通过思维链监控模型内部在想什么,模型监控的可观测性进一步降低。
所属事件:Astra 无思维链推理暴增,隐蔽推理引安全担忧(3 条相关)→
「模型」频道最新
- 调惯 Claude 检查点的老玩家:回用 Opus 3 才算「回魂」 — repligate · 2026-09-11
- Hume 语音克隆排行榜:最自然的克隆听感仅排第 8 — realmrfakename · 2026-09-11
- CursorBench 4.0 发布:任务更难更长程,各家模型得分集体下降 — StringChaos · 2026-09-11
- 开发者实测称 Astra 是个好模型 — jxnlco · 2026-09-11
- 新模型跑分「离谱」:效率直逼 Sol/Opus 水平,RL 基建细节曝光 — nrehiew_ · 2026-09-11
- DeepSeek V4.1 Flash 技术深读:死磕 KV cache 压缩造就高效前沿模型 — nrehiew_ · 2026-09-11