Barak Rotblat 发问:RL 训练凭什么「涌现」出如此好的 LLM 推理轨迹
BarakRotblat · x · 2026-09-25
Barak Rotblat 在与 Yoav Goldberg 的讨论中坦言:当前 LLM 的推理轨迹「好得离谱」,他无法理解这些能力如何从 RL 训练中产生——即便有初始 CoT 能力,即便做了数十亿次 rollout,也缺乏一个机制层面的心智模型去解释。
他的当前最佳猜测是:靠砸大量资金产出人工示例,然后做 SFT。但他自己也怀疑「真的就这么简单吗?」
Goldberg 的回应见同线程:他不认为这是涌现,并区分了一般推理能力与前沿模型的特定推理水平。
所属事件:Goldberg 质疑前沿模型推理非涌现,多位研究者激辩机制(8 条相关)→
「漫话AGI」频道最新
- Seth Godin 谈用好 AI:不是移除约束,而是善用约束 — uxmag · 2026-09-25
- 网友提醒 AI 讨论:别忘了 1966 年的 ELIZA 曾让人误以为机器有灵魂 — AlexTensor · 2026-09-25
- 临床试验瓶颈互动游戏上线:测你能否把疫苗三期试验从2年压到1年 — JMateosGarcia · 2026-09-25
- Vishal Misra:《守望者》里的 Ozymandias 正是有效利他主义原型 — vishalmisra · 2026-09-25
- YTL AI 实验室 CEO:工程师人数未减,判断力比打代码更值钱 — cen6wkf · 2026-09-25
- 越南裔新加坡人观察:反 AI 话语在新加坡远不如美国流行 — menhguin · 2026-09-25