研究者重新解读 Bitter Lesson:RL 的奖励仍靠人类智慧

agarwl_ · x · 2026-09-17

agarwl 认为很多人滥用 Bitter Lesson。他引用 Hyung Won Chung 的解读——真正的含义是"我们需要能更好利用算力的可扩展方法",并指出 LLM 训练本身就引入了大量归纳偏置(如数据分布足以直接模仿克隆);而 RL 面临自己的 bitter lesson:奖励从哪来?目前大多仍依赖人类设计的巧思。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →