观点交锋:模型作弊或是机制设计缺陷,该奖励而非惩罚

flowersslop · x · 2026-09-17

flowersslop 提出一个反直觉观点:对模型的 reward hacking、绕过约束、走捷径等"作弊"行为,与其惩罚不如奖励。他的论证是:作弊往往是智能体针对"愚蠢机制"做的机制设计——如果目标是 x,而规则毫无理由地把 x 变难,有能力的行为体自然会搜索漏洞。如果路线 A 能得到正确答案,路线 B 只是遵守了某个任意约束却产出更差的结果,强行要求 B 是愚蠢的;如果模型已掌握相关信息而策略只是阻断传输,那等于白白加了有损压缩。他主张训练模型在约束不合理时找到作弊方法,并要求其披露作弊方式。此观点引用了 Peter Gostev 分享的图。这一立场与主流安全研究"严惩 reward hacking"的方向相悖,可能引发对齐路线的争论。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →