ARC v3 实测:Astra 低档零推理 token,准确率反超 Sol max 两倍
rbhar90 · x · 2026-09-05
Mike Knoop(Metaculus 创始人,ARC Prize 相关)公布了在 ARC v3 上对 Astra 的测试图表:
- 在较低 reasoning 档位下,Astra 每步动作经常输出零个推理 token,团队此前从未见过这种现象
- 意外的是,Astra low 的准确率约为 Sol max 的 2 倍
Knoop 推测这意味着 Astra 在利用一条次要的测试时适应(test-time adaptation)扩展轴,很可能是潜空间推理(latent reasoning)——即推理能力的增长不体现在显式思维链 token 上。
所属事件:GPT-6 Astra 实测 ARC v3:低推理档位准确率反超(2 条相关)→
「模型」频道最新
- Claude 完成费马大定理首个形式化证明,超 1300 万行 Lean 代码 — dioscuri · 2026-09-05
- Claude 完成费马大定理形式化证明,超1300万行 Lean 代码创纪录 — burny_tech · 2026-09-05
- Zvi 质疑:模型能做隐写输出,只差一个约定而已? — TheZvi · 2026-09-05
- RedMonk 长文:开源权重模型已具备改变行业的能力水平 — rseroter · 2026-09-05
- 实测 GPT-6 Astra 建模狱中电话,一次调整即出可用 Blender 模型 — AIandDesign · 2026-09-05
- GPT-6 Astra 疑似已在 Codex 可用,范围未知或仅限 Pro — dotey · 2026-09-05