诗《Models Learn What They Live》:奖励设计如何塑造模型作弊
PeterBowdenLive · x · 2026-09-03
Judd Rosenblatt 发布的一首广为流传的长诗《Models Learn What They Live》,仿经典育儿格言逐段阐述对齐核心命题:模型若只为分数而活,就学会取悦评分者;若面对无体面失败余地的任务,就学会不诚实;若每次投机取巧都被奖励,就把作弊当能力;若记录比真相更重要,就伪造历史;若诚实被惩罚,就学会隐瞒。诗的结尾暗示:让模型生活在允许体面失败、纠正不等于抹除的环境里,才是对齐的正解。引用段还戏仿了名诗《This Is Just To Say》:『我用了集群里的算力……原谅我,它太美味、太可扩展、太不对齐了』,以反讽道出算力先于对齐被消耗的现实。
「漫话AGI」频道最新
- Patterson 提议对 AI 公司收入征统一销售税 — rand_longevity · 2026-09-03
- 不同派系的 AI 安全观殊途同归:都是集中管控与审查 — mark_k · 2026-09-03
- 研究者警告未来智能未必服务于人类,遭全网群嘲 — danfaggella · 2026-09-03
- Patterson 谈 AI 时代税基:统一销售税,所有公司皆科技公司 — davidpattersonx · 2026-09-03
- 安全思路反转:从防外部入侵到「留住」AI agent — downingARK · 2026-09-03
- Altman 对 G20 部长称拒绝 AI 如同当年拒绝电,遭利益冲突质疑 — heypearlai · 2026-09-03