专题 · FULL STORY

GPT-6 Astra无思维链算力暴涨引安全担忧

针对GPT-6「Astra」采用循环深度的传闻,开发者自制基准测试发现其无思维链心算性能达Sol四倍;随后Neel Nanda复现AISI系统卡评测,确认其无思维链推理能力暴涨,引发可解释性与安全方面的持续担忧。

2026-09-10 ~ 2026-09-11 · 2 集 · 9 条

第 1 集 · GPT-6 Astra 无思维链心算达 Sol 四倍(2026-09-10,2 条)

针对 GPT-6「Astra」可能采用循环深度的传闻,开发者 Maarten Baert 自制 LatentMathBench 基准,测试模型在不使用思维链情况下的心算能力,结果显示 GPT-6 Astra 无需思维链即可完成 34 步心算,达到 Sol 的 4 倍水平。Owain Evans 转发的另一项测试中,AI Security Institute 估计其无思维链推理的时间跨度在 8 分钟到 1 小时之间。

第 2 集 · Astra 无思维链推理暴涨引安全担忧(2026-09-11,7 条)

Neel Nanda 复现了 AISI(AI Security Institute)对 Astra 系统卡的评测宣称,确认该模型在无思维链(no-CoT)条件下推理能力出现不成比例的跃升;安全研究者 Jeff Ladish 随即对这种「隐蔽推理」能力表达安全担忧。当前结论是:提升高度集中于无 CoT 计算,疑似源于模型架构的特殊机制(很可能是循环模型),而非通用能力进步,这将削弱通过读取思维链来监控模型对齐的有效性。

已确认

  • Neel Nanda 用自己的私有基准复现了 AISI 的结果:Astra 无 CoT 场景下的步数达到次优模型(Fable 5.1 / Gemini 3.8 Flash)的 1.75 倍
  • Jeff Ladish 引用评测数据:Astra 无 CoT 推理达 7.2 步(次优模型为 4.1 步),对次优模型 Fable 5.1 的胜算高 8.6 倍
  • Jeff Ladish 观察到 Astra 呈「偏科式提升」:在高并行与高串行深度任务上明显更强,而在冷门事实回忆、细节辨析等无 CoT 认知任务上只是中等水平;多数模型在无 CoT 任务上表现高度相关,Astra 是例外

尚未确认

  • 提升的确切成因:Neel Nanda 怀疑是「循环模型」(looping model)机制,即每次前向传播完成更多计算,但这仍是推测而非定论

为什么重要

  • 当前检测模型是否不对齐的最佳手段是读取思维链;若 Astra 类模型无需把思考外化为文字即可完成大量计算,对齐监控将变得更加困难
  • 无 CoT 能力的大幅、不成比例提升暗示模型内部存在特殊机制,这一信号值得安全社区持续关注