Yoav Goldberg 困惑:如今 LLM 的超长推理链究竟如何涌现?

odedbendov · x · 2026-09-25

AI 研究者 Yoav Goldberg 提出一个行业级疑问:当前 LLM 的推理轨迹(reasoning traces)质量高得令他不解——即使模型已具备初步 CoT 能力、即使做了数十亿次 rollout,他仍无法建立「这些能力如何从 RL 训练中涌现」的心智模型。他猜测秘诀可能是投入巨资制作人类示例再做 SFT,但不确定。Oded Bendov 回应推荐了一个拆解整个技术栈的讲解视频,Goldberg 则表示该视频能解释 DeepSeek R1 那一代模型的短推理,却解释不了如今更长更复杂的推理是如何实现跨越的。

所属事件:Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制(8 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →