研究员激辩:LLM 推理能力到底是不是「纯粹堆 RL」涌现出来的

brianryhuang · x · 2026-09-25

Yoav Goldberg 提出困惑:当前 LLM 的推理轨迹好得令人无法理解,他不明白这些能力怎么能从 RL 训练中「涌现」出来——他的猜测是靠大量人工标注样例做 SFT,但不确定。brianryhuang 回应称,答案虽然智力上不令人满意,但确实就是把 RL scaling 推下去,是「简单」RL 训练的涌现。

所属事件:Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →