研究者重新解读 Bitter Lesson:RL 的奖励仍靠人类智慧
agarwl_ · x · 2026-09-17
agarwl 认为很多人滥用 Bitter Lesson。他引用 Hyung Won Chung 的解读——真正的含义是"我们需要能更好利用算力的可扩展方法",并指出 LLM 训练本身就引入了大量归纳偏置(如数据分布足以直接模仿克隆);而 RL 面临自己的 bitter lesson:奖励从哪来?目前大多仍依赖人类设计的巧思。
「漫话AGI」频道最新
- Noam Brown 深谈 Agent 集群、对齐与递归自我改进 — Recoil42 · 2026-09-18
- Polymarket 用 AI 编码代理重写 Rust API,p99 延迟降九成 — ivan_bezdomny · 2026-09-17
- OpenAI AGI 经济学主管:AI 是发展中国家的「移动支付式跃迁」 — daveholtz · 2026-09-17
- 「Astra 擅长 CAD,不代表你不用会 CAD」引热议 — _Stocko_ · 2026-09-17
- 哲学家 Seth Lazar 宣布兼职加入独立 AI 安全机构 Resolution — sethlazar · 2026-09-17
- 世界患者安全日:医疗 AI 该让医生看到模型的不确定性 — moniquejmorrow · 2026-09-17