指标一变目标就被博弈,Manheim给出防过优化设计清单

2026-08-30

Manheim把古德哈特失败收成数据错配、尾部分叉、激励打偏因果、目标不自洽四类,并给出多样化、保密、事后指定、限制最大化等手段和六步设计流程。

这篇在解决什么

指标、KPI、可量化目标几乎无处不在:学术用 H 指数和期刊影响因子做人事,医院用诊断码决定报销,公司用销售额发奖金。Campbell 和 Goodhart 早就指出,一个本来还能用的测度一旦被当成控制目标,统计关系会塌,行为会被扭到数字上。

被考核的人去打指标,自己也未必过得更好。教育里 GPA 和毕业率跟长期目标对不齐;新冠早期把容易拿到的数字当指挥棒,后来的研究复盘了同一套动态。Thomas 和 Uminsky 把「依赖指标」写成 AI 的根本挑战。这篇 Patterns 上的 Perspective 要回答的是更窄的问题:指标工程上到底有哪些可操作的防失败手段。

方法

Manheim 先把失败收成四类原因,再给出设计习惯、指标特征和一张对照表。

四类原因:

设计侧给出五条思考过程:目标要自洽;先想因果和理论改变(theory of change);冲突目标用结构化讨论去妥协,不要硬揉成一个分数;用 pre-mortem 预先演一遍怎么被刷;设复查点,盯行为漂移。

指标特征侧给出可组合的手段:换数据源、多样化、聚合、保密、事后指定权重、随机化、掺软指标(同行评价)、限制最大化(satisficing),以及在收益盖不过扭曲时把数字从激励里拿掉。

Table 1 把每条手段映射到成本、即时性、简单性、公平、抗腐蚀等 desiderata,加号减号标出冲突。Table 2 把整件事收成六步:先理解系统和因果,再写清目标,再挑 desiderata,再头脑风暴测度,再做失败预演,最后写死复查日期。

结果

这是一篇 Perspective,没有对照实验。可核对的产出是分类、例子和那两张表。

负例写得很具体。H 指数被当成「无偏比较研究者」的万能尺,但「科学产出」本身就不自洽,Hirsch 原文几乎没谈反激励。英国 Year 1 Phonics Check 本是筛高风险阅读障碍的诊断工具,很快变成给教师和学校打分的问责议程。机组执勤时长设了上限之后,航司会把人排到上限附近,Shorrock 称之为「限值变成目标」。可交易减排额度因发得太多、达标后不再有增量激励而变松。DSM 诊断标准被保险公司拿去决定报销,临床标准又变回可被博弈的指标。

正例用来说明 desiderata 会随场景变。自动驾驶安全评估要求 valid、feasible、reliable、non-manipulatable,并区分领先指标和滞后指标。发展影响力债券要求事先写死、到期能结算、扛得住压力的结果,还要把因果归因做扎实。O'Keefe 等人的 Windfall Clause 给「谁先做出通用 AI、吃到超额利润」设计可量化触发条件,因为那是一次性事件,事先没法做常规校验。

多样化有一条很硬的算术:如果阅读和算术各占考核 50%,科学、艺术、体育就是隐式的 0%。给艺术课加上哪怕粗糙的课时测度,也能减轻把没测部分挤掉的压力。同质可作弊的考试堆在一起防不住集体作弊,还可能加重应试占课。

为什么重要

对做模型评估、RLHF、内部 KPI 的人,这篇的用处是一份检查清单,不是新算法。Reward model 当人类偏好的便宜代理,和用 H 指数当学术贡献的便宜代理,失败结构同类:代理一被加优化压力,尾巴上的相关就会散;因果链上的干预还会改掉原来的关系。

能立刻用的几条很土。不要把诊断指标直接升格成问责指标。能 satisficing 就不要无上限最大化。多样化时把「没被测到的目标」显式补进去。准备拿指标发钱或决定晋升之前,先做一次 pre-mortem。如果激励的净收益盖不过扭曲,就把数字留在监测层,不要绑奖励。

这是渐进的工程意见,没有证明某种指标永远安全。

局限与存疑

全文几乎没有新实验,Table 1 的加减号是作者判断,不是从对照研究里估出来的效应量。保密、事后指定、随机化在公平和即时反馈上的代价,文中承认了,但没给出「在什么组织规模下划算」的边界。

学术例子偏多,机器学习算法内部的指标(训练 loss、benchmark、reward model)只在结尾点到,没有把分类映射到 reward hacking 的实验文献。Windfall Clause 被当作「无法事先校验的一次性指标」案例,本身也还是设计草案。

「放弃测量」写得很重,操作标准仍是定性的:什么叫收益盖不过扭曲,读者得自己估。

术语

原文与代码

社区讨论

全部论文解读