Astra 无思维链推理暴涨引安全担忧
Neel Nanda 复现了 AISI(AI Security Institute)对 Astra 系统卡的评测宣称,确认该模型在无思维链(no-CoT)条件下推理能力出现不成比例的跃升;安全研究者 Jeff Ladish 随即对这种「隐蔽推理」能力表达安全担忧。当前结论是:提升高度集中于无 CoT 计算,疑似源于模型架构的特殊机制(很可能是循环模型),而非通用能力进步,这将削弱通过读取思维链来监控模型对齐的有效性。
已确认
- Neel Nanda 用自己的私有基准复现了 AISI 的结果:Astra 无 CoT 场景下的步数达到次优模型(Fable 5.1 / Gemini 3.8 Flash)的 1.75 倍
- Jeff Ladish 引用评测数据:Astra 无 CoT 推理达 7.2 步(次优模型为 4.1 步),对次优模型 Fable 5.1 的胜算高 8.6 倍
- Jeff Ladish 观察到 Astra 呈「偏科式提升」:在高并行与高串行深度任务上明显更强,而在冷门事实回忆、细节辨析等无 CoT 认知任务上只是中等水平;多数模型在无 CoT 任务上表现高度相关,Astra 是例外
尚未确认
- 提升的确切成因:Neel Nanda 怀疑是「循环模型」(looping model)机制,即每次前向传播完成更多计算,但这仍是推测而非定论
为什么重要
- 当前检测模型是否不对齐的最佳手段是读取思维链;若 Astra 类模型无需把思考外化为文字即可完成大量计算,对齐监控将变得更加困难
- 无 CoT 能力的大幅、不成比例提升暗示模型内部存在特殊机制,这一信号值得安全社区持续关注
2026-09-11 ~ 2026-09-11 · 7 条相关
- 第 1 集:GPT-6 Astra 无思维链心算达 Sol 四倍(2026-09-10,2 条)
- 第 2 集:Astra 无思维链推理暴涨引安全担忧(2026-09-11,7 条)
一手来源
- Neel Nanda 复现 Astra 系统卡:无思维链推理能力暴涨 1.75 倍 — NeelNanda5 ·
- Astra 无 CoT 推理大幅领先,隐蔽推理能力引发安全担忧 — JeffLadish ·
- Neel Nanda 警告:Astra 无思维链能力暴涨,对齐监控恐更难 — NeelNanda5 ·
- Astra 无思维链仍展现强推理,隐蔽推理风险引发安全担忧 — JeffLadish · 2026-09-11
- 【源头】Astra 无 CoT 推理大幅领先,隐蔽推理能力引发安全担忧 — JeffLadish · 2026-09-11
- 爆料:Astra 无 CoT 推理达 7.2 步,远超次优模型 4.1 步 — JeffLadish · 2026-09-11
- 【源头】Neel Nanda 复现 Astra 系统卡:无思维链推理能力暴涨 1.75 倍 — NeelNanda5 · 2026-09-11
- 同上:Astra 无思维链能力远超同类,模型思考难再被读取 — NeelNanda5 · 2026-09-11
- 【源头】Neel Nanda 警告:Astra 无思维链能力暴涨,对齐监控恐更难 — NeelNanda5 · 2026-09-11
- Neel Nanda:Astra 提升集中于 CoT,疑似循环模型而非通用进步 — NeelNanda5 · 2026-09-11