Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制
9 月 25 日,AI 学者 Yoav Goldberg 与多位研究者在推特上围绕「前沿模型的推理能力从何而来」展开讨论。Goldberg 表达行业级困惑:当前 LLM 的推理轨迹(reasoning traces)质量高得让他无法理解——即使模型已有初步 CoT 能力、即使做了数十亿次 rollout,他仍无法建立心智模型解释这些能力如何从 RL 训练中「涌现」。Barak Rotblat 坦言同样困惑:这些轨迹「好得离谱」,缺乏机制层面的解释。
已确认
- Goldberg 澄清立场:他质疑的不是一般意义上的推理如何产生,而是当前前沿模型展现的特定类型与水平的推理;他明确表示不认为这些能力是「涌现」(emergent)。
- Goldberg 补充:现有公开技术栈大致能解释 DeepSeek R1 那一代模型「短而尚可」的推理,但从短推理到如今长而复杂的推理之间是什么填补了鸿沟,他完全无法解释。
- Goldberg 用类比说明自己的判断:问题更像「国际象棋大师的训练 routine 是什么」,而非「人脑如何下棋」——答案可能不在某种无人能懂的神秘潜在过程,而在具体的训练流程。
- brianryhuang 参与交锋,观点见下。
尚未确认
- 推理能力究竟主要来自 RL 涌现还是大规模 SFT 标注,Goldberg 明确表示不确定,其猜测只是假设;他后续表态倾向于将其视为训练流程问题而非黑箱涌现。
- brianryhuang 的「零 SFT 纯 RL 即可实现超人类推理」是理论层面的主张,尚未被公开实证确认。
为什么重要
- 这场讨论触及当前推理模型热潮中最核心的机制问题:模型为何会推理、能力来自何处,直接关系到训练配方、数据投入方向与可复现性。
- brianryhuang 的观点颇具代表性:人工精选样例上的 SFT 只是抬高 scaling 曲线截距的加分项而非必要条件,超人类推理理论上可零 SFT 实现。若成立,意味着 RL 路线的天花板与成本结构可能与主流认知不同。
2026-09-25 ~ 2026-09-25 · 8 条相关
一手来源
- Yoav Goldberg:LLM 推理链强得反常,难以解释其如何从 RL 中涌现 — yoavgo ·
- 从 R1 到今天:短推理与长推理之间的能力鸿沟无人能解释 — yoavgo ·
- Yoav Goldberg:当前前沿模型的推理能力并非「涌现」 — yoavgo ·
- 【源头】Yoav Goldberg:LLM 推理链强得反常,难以解释其如何从 RL 中涌现 — yoavgo · 2026-09-25
- 【源头】从 R1 到今天:短推理与长推理之间的能力鸿沟无人能解释 — yoavgo · 2026-09-25
- 进一步交锋:SFT 只抬基线,超人类推理理论上零 SFT 靠 RL 即可 — brianryhuang · 2026-09-25
- Barak Rotblat 发问:RL 训练凭什么「涌现」出如此好的 LLM 推理轨迹 — BarakRotblat · 2026-09-25
- 【源头】Yoav Goldberg:当前前沿模型的推理能力并非「涌现」 — yoavgo · 2026-09-25
- Yoav Goldberg:前沿模型推理更像训练流程问题而非黑箱涌现 — yoavgo · 2026-09-25
另有 2 条近重复转述:brianryhuang · odedbendov