爆料:Astra 无 CoT 推理达 7.2 步,远超次优模型 4.1 步
JeffLadish · x · 2026-09-11
JeffLadish 分享对模型 Astra 的实测观察:Astra 呈现「偏科式提升」——多数模型在无 CoT 任务上表现高度相关,而 Astra 在高并行与高串行深度任务上明显更强,在冷门事实回忆、细节辨析等无 CoT 认知任务上只是「很好」。
关键数据:
- 无 CoT 串行深度(合成推理任务,50% 成功率)约 7.2 个算术步骤,次优的 Gemini 3.8 Flash 与 Fable 5.1 为 4.1 步,该比例在不同任务间较为一致。
- 无 CoT 完成推理任务的胜率是次优模型(Fable 5.1)的 8.6 倍。
作者认为这很可能源于其循环(looping)架构,但强调尚未证实。他解释关注无 CoT 推理的意义:它是模型在不依赖思维链时能完成多少工作的良好代理指标。
所属事件:Astra 无思维链推理暴涨引安全担忧(7 条相关)→
「模型」频道最新
- OpenAI 内部模型被称已证明 Navier-Stokes 千禧年难题 — QuintinPope5 · 2026-09-11
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11