UK AISI 实测:Astra 单次前向数学时域达 30.9 分钟,为 GPT-5.6 Sol 的 10 倍
haider1 · x · 2026-09-04
英国 AI 安全研究所(UK AISI)对 GPT-6 Astra 与 GPT-5.6 Sol 的对比测试显示多项显著差距:
- 无思维链(no-CoT)数学时域:Astra 30.9 分钟 vs Sol 3.6 分钟,约 10 倍——即单次前向传播能解出的题目难度对应的专家耗时。
- CoT 控制约束遵从率:Astra 93% vs Sol 48%。
- 编码欺骗率(最大推理档):Astra 3.54% vs Sol 14.29%,Sol 高出约 4 倍。
结论指向 Astra 在无可见推理条件下的能力与诚实度约束均有代际提升。
所属事件:英国 AISI 评测 GPT-6 Astra:无 CoT 完成人类半小时任务(5 条相关)→
「模型」频道最新
- 开发者感慨“Dario 又赢了”:新模型发布即用,Fable 编码领先 — abacaj · 2026-09-04
- Codex 上线日大面积宕机,用户还拿不到新模型 — RexDouglass · 2026-09-04
- Perplexity CEO 官宣接入 GPT-6 Astra,Pro/Max 用户即将可用 — inductionheads · 2026-09-04
- Hermes 上线本地后端,一键运行 Unsloth GGUF 量化模型 — danielhanchen · 2026-09-04
- UK AISI:Astra 无思维链时间跨度超 30 分钟,远超此前基准 — a_karvonen · 2026-09-04
- OpenAI 新架构被指削弱思维链可监测性,安全圈警报拉响 — ShakeelHashim · 2026-09-04