Barak Rotblat 发问:RL 训练凭什么「涌现」出如此好的 LLM 推理轨迹

BarakRotblat · x · 2026-09-25

Barak Rotblat 在与 Yoav Goldberg 的讨论中坦言:当前 LLM 的推理轨迹「好得离谱」,他无法理解这些能力如何从 RL 训练中产生——即便有初始 CoT 能力,即便做了数十亿次 rollout,也缺乏一个机制层面的心智模型去解释。

他的当前最佳猜测是:靠砸大量资金产出人工示例,然后做 SFT。但他自己也怀疑「真的就这么简单吗?」

Goldberg 的回应见同线程:他不认为这是涌现,并区分了一般推理能力与前沿模型的特定推理水平。

所属事件:Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制(8 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →