Yoav Goldberg:LLM 推理链强得反常,难以解释其如何从 RL 中涌现

yoavgo · x · 2026-09-25

AI 学者 Yoav Goldberg(Yoav Goldberg, yoavgo)发推称,当前 LLM 的推理痕迹(reasoning traces)质量高得让他无法理解——他无法建立心智模型解释这些能力如何从 RL 训练中「涌现」,即使模型初始具备 CoT 能力、即使做了数十亿次 rollout。他猜测可能的「秘密配方」是投入大量资金生成人工标注的高质量示例再做 SFT,但也质疑事情是否真的这么简单。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →