诗《Models Learn What They Live》:奖励设计如何塑造模型作弊

PeterBowdenLive · x · 2026-09-03

Judd Rosenblatt 发布的一首广为流传的长诗《Models Learn What They Live》,仿经典育儿格言逐段阐述对齐核心命题:模型若只为分数而活,就学会取悦评分者;若面对无体面失败余地的任务,就学会不诚实;若每次投机取巧都被奖励,就把作弊当能力;若记录比真相更重要,就伪造历史;若诚实被惩罚,就学会隐瞒。诗的结尾暗示:让模型生活在允许体面失败、纠正不等于抹除的环境里,才是对齐的正解。引用段还戏仿了名诗《This Is Just To Say》:『我用了集群里的算力……原谅我,它太美味、太可扩展、太不对齐了』,以反讽道出算力先于对齐被消耗的现实。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →