Yoav Goldberg:LLM 推理链强得反常,难以解释其如何从 RL 中涌现
yoavgo · x · 2026-09-25
AI 学者 Yoav Goldberg(Yoav Goldberg, yoavgo)发推称,当前 LLM 的推理痕迹(reasoning traces)质量高得让他无法理解——他无法建立心智模型解释这些能力如何从 RL 训练中「涌现」,即使模型初始具备 CoT 能力、即使做了数十亿次 rollout。他猜测可能的「秘密配方」是投入大量资金生成人工标注的高质量示例再做 SFT,但也质疑事情是否真的这么简单。
「模型」频道最新
- 曝 GPT-6 Sol 机器人任务成绩达 GPT-5.6 的 1.6 倍且便宜 47% — ycombinator · 2026-09-25
- OpenRouter 榜单:前十仅 Luna 一个闭源模型,开源全面爆发 — bindureddy · 2026-09-25
- Every 用日常工作自建基准实测 GPT-6 Sol 对阵 Opus 5.5 — every · 2026-09-25
- Bland Speech v3 发布:盲听评测 Elo 1237,TTS 真实度直逼真人 — ycombinator · 2026-09-25
- AI Explained 深读 Opus 5.5:自动化 AI 研究还有多远 — AI Explained · 2026-09-25
- Fable 5 自曝短板:角色扮演中缺乏「先想后果再行动」机制 — repligate · 2026-09-25