研究员激辩:LLM 推理能力到底是不是「纯粹堆 RL」涌现出来的
brianryhuang · x · 2026-09-25
Yoav Goldberg 提出困惑:当前 LLM 的推理轨迹好得令人无法理解,他不明白这些能力怎么能从 RL 训练中「涌现」出来——他的猜测是靠大量人工标注样例做 SFT,但不确定。brianryhuang 回应称,答案虽然智力上不令人满意,但确实就是把 RL scaling 推下去,是「简单」RL 训练的涌现。
所属事件:Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制(8 条相关)→
「研究」频道最新
- LFM2.5-2.6B 后训练配方:SFT+RL+蒸馏四步走 — helloiamleonie · 2026-09-25
- 多域 on-policy 蒸馏:让一个模型同时学多种技能 — helloiamleonie · 2026-09-25
- On-policy 蒸馏图解:teacher 按逐 token 给学习信号 — helloiamleonie · 2026-09-25
- 可验证奖励 RL 为何不够:奖励信号太稀疏 — helloiamleonie · 2026-09-25
- Liquid AI 提出 Antidoom 训练,将模型死循环率从 10% 降至 1% — helloiamleonie · 2026-09-25
- Liquid AI 员工长文拆解端侧小模型设计:antidoom 训练把死循环从 10% 降到 1% — helloiamleonie · 2026-09-25