Nat Lambert 讲过优化、奖励黑客与刷榜失真
natolambert · x · 2026-07-25
Nat Lambert 做了一场更短的讲座,主题是过优化(over-optimization)、奖励黑客、迎合性(sycophancy)和冗长输出。
- 讲座从 Goodhart 定律 出发,回顾过优化的基础概念与历史脉络。
- 他指出,rubric 评分标准也会像 reward model 一样被“优化到失真”,而 RLVR 应被视为一种独立机制,而不只是换个说法。
- 内容还讨论了失配/对齐问题的表现、为什么不能把问题简单归结为“只是风格问题”,以及 Llama 4 刷榜这类 leaderboard gaming 现象。
- 整体是一次以 Chapter 14 为中心的总结式反思。
所属事件:专家讲座探讨大模型过优化与奖励黑客等失真问题(3 条相关)→
「漫话AGI」频道最新
- 组织本身或许就是地球上的超智能 — eldonredwards · 2026-07-27
- AI 竞赛里的持久护城河可能只剩能源和信息 — GregKamradt · 2026-07-27
- 有人主张先造 AGI,再把它开源 — wordgrammer · 2026-07-27
- Jason Crawford 说 AI 不该只谈对齐,而该守法守伦理 — Afinetheorem · 2026-07-27
- OpenAI 和 Anthropic 证明没人知道 agentic AI 下一步 — shashib · 2026-07-27
- 长文主张:开放模型是保护人的 AI 未来关键 — VoidStateKate · 2026-07-27