Nat Lambert 讲过优化、奖励黑客与刷榜失真
natolambert · x · 2026-07-25
Nat Lambert 做了一场更短的讲座,主题是过优化(over-optimization)、奖励黑客、迎合性(sycophancy)和冗长输出。
- 讲座从 Goodhart 定律 出发,回顾过优化的基础概念与历史脉络。
- 他指出,rubric 评分标准也会像 reward model 一样被“优化到失真”,而 RLVR 应被视为一种独立机制,而不只是换个说法。
- 内容还讨论了失配/对齐问题的表现、为什么不能把问题简单归结为“只是风格问题”,以及 Llama 4 刷榜这类 leaderboard gaming 现象。
- 整体是一次以 Chapter 14 为中心的总结式反思。
所属事件:专家讲座探讨大模型过优化与奖励黑客等失真问题(3 条相关)→
「漫话AGI」频道最新
- Cohere Labs 推出交互工具:测 178 种职业哪些任务会被 AI 自动化 — Cohere_Labs · 2026-09-11
- AI 安全人士上 SkyNews 担忧不平等、滥用与社会激励结构 — schwarzjn_ · 2026-09-11
- 风投人士讽 AI 末日论:与疫情恐慌话术如出一辙 — StewartalsopIII · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- AI 陪伴的隐秘代价:它消解了建立真实亲密关系所需的摩擦 — YogeshMalik · 2026-09-11