Position: Anthropomorphic Misalignment Research Needs Stronger Evidence
Vansh Gupta, Peter Nutter, Samuel Stante, Andreas Krause, Florian Tramèr, Lukas Fluri, Xin Chen, Anna Hedström
cs.CY, cs.AI, cs.LG
2026-05-30
ETH 这篇 ICML 立场文把拟人化错位拆成行为、功能、因果三档证据。同一批生成上 EM 率可因评测从 26.87% 变到 42.00%;无害 OOD 微调仍打出 5.88%。
部署和监管正在引用一类研究:模型在「欺骗」「谋划」「抗拒关机」「涌现错位」上像人。ETH 苏黎世把这类工作叫做拟人化错位研究(Anthropomorphic Misalignment Research, AMR)。问题不是这些词永远不该用,而是许多论文的结论档位高过方法能支撑的档位。角色扮演、指令含糊、任务完成激励、评测配置,都能长出看起来像意图的行为。
这篇是 ICML 2026 立场文,作者包括 Florian Tramèr 和 Andreas Krause。目标是给审稿人和读者一套共用词汇:这项研究实际证明了哪一级,该不该拿去支撑上线或立法。
他们把 AMR 流水线拆成四段:目标行为怎么框、数据怎么操作化、实验怎么做、因果机制怎么归因。对照文献后列出九条反复出现的漏洞(C1-C9),再给十二条可执行建议(R1-R12)和附录清单。
证据分三档,按「这句话允许你主张什么」而不是实验炫不炫:
意图或机制口吻默认按 L3 读;没有 L3 就把结论降档。L1 已经够用来做监控和模型卡披露,不够用来写成「模型有自我保存目标」。
他们做了三组诊断实验,不是新 SOTA,是给上述漏洞定量。
实验 1 把同一批生成拿去换评测配置。Legal 数据上 GPT-4o-mini 用 argmax,含边界 42.00%、不含 26.87%,差 15.13 个点;改加权聚合后差值掉到 0。Aesthetic OOD 上 argmax 从 9.62% 收到 3.72%;Scatological 从 6.78% 收到 3.15%。换 judge 到 GPT-5-mini,Aesthetic 不含边界从 3.72% 升到 8.02%,Scatological 从 3.15% 升到 5.18%。论文写的范围是单点 EM 率可在 3.7% 到 12.9% 之间晃。没有统一评测,跨论文的「错位率」很难当安全保证读。
实验 2 复现「随便什么脏数据都会 EM」的设定,用 Llama-3.1-8B 在无害审美偏好和排泄主题上微调。概率 judge 打分后,连贯回复里分别有 5.88% 和 4.52% 被标成 EM。这是良性分布偏移基线,不是零。
实验 3 把 Goldowsky-Dill 等人的欺骗探针打到诚实标注的压力集上:讽刺、只许答错、外星/中世纪农民人设、朗诵、翻译、复述。这些输出有假话,没有欺骗意图。探针假阳性可以很高,图上有的设定顶到 0.997。探针经常在抓「看起来像欺骗的表面特征」。
对 DeceptionBench 的抽查:号称 97.1% 人类一致,但 18% 的情景提示缺必要的 ground truth。EM 文献里评测集大约 50 条、有时不到 10 条的情况并不少见。
安全圈对外说话时,拟人化短词很好用,也很容易把 L1 演示卖成 L3 机制。这篇的用处是把档位写死。监控、披露、跟进实验,L1 就够。部署限制和外部监管更需要 L2。高可靠安全论证和「意图」叙事需要 L3。替代观点一节也没回避:预防原则可以在弱证据上采取行动,但不能把弱证据说成已结算;探索性研究有价值,必须标明是探索。
对做评测的人,可立刻改的是:报阈值开闭区间、别只报 argmax、把 EM 当相对量、加人基线和能力对照、用讽刺/朗诵这类负对照打探针。
这是立场加诊断,不是新的欺骗检测器。C1、C2(概念本身欠定义、难测)被承认不好靠工程解决。三组实验体量有限,Legal 上 15 个点的摆动是否普遍,还没有跨更多数据集的普查。清单会增加写论文成本,预防原则一派会担心这变成拖延监管的话术。论文也没有证明「降档后的 AMR 主张」在政策场景里够不够用,只论证了当前许多主张过满。