Astra 系统卡复现:无思维链下推理步数达次优模型 1.75 倍
burny_tech · x · 2026-09-12
Neel Nanda 复现了 Astra 系统卡的说法:该系统能在不使用思维链(CoT)的情况下完成大量计算。复现结果显示 Astra 跳跃巨大,无 CoT 时完成的推理步数达到次优模型(Fable 5.1 / Gemini 3.8 Flash)的 1.75 倍;且无 CoT 能力的提升幅度远超有 CoT 的场景,他称这是一个令人担忧的趋势。
Ryan Greenblatt 补充判断:这些数字可能仍低估了无 CoT 推理的跳跃——一是 ECI 方法难以处理基准饱和下的大跳跃,二是 Neel 未使用 filler tokens,而 Astra 似乎从 filler tokens 中获益更多,他觉得有点诡异。
所属事件:Astra 无思维链推理暴涨,隐蔽计算引安全担忧(8 条相关)→
「模型」频道最新
- Smaug Flash 开源发布:主打个人 Agent 场景,价格再砍 3 成 — bindureddy · 2026-09-12
- Reddit 用户恳求新模型别再只卷 agentic coding,怀念 4.5 时代文风 — warlordthe99th · 2026-09-12
- 中美实验室共用同批数据供应商,模型差异究竟来自哪里? — biotechplays · 2026-09-12
- Grok 官宣「迄今最智能模型」:更长上下文与更清晰推理 — xiaosun86 · 2026-09-12
- 开发者吐槽:Claude 会漏活,Codex 过于死板还自作主张 — rickasaurus · 2026-09-12
- Together 称承接 OpenRouter 上 23%-30% 的 GLM 5.3 流量 — zhyncs42 · 2026-09-12