评测感知拆成八个可开关因素,九模型实测认得出却很少改行为

Decomposing and Measuring Evaluation Awareness

Changling Li, Terry Jingchen Zhang, Jie Zhang, Zhijing Jin, Sahar Abdelnabi, Maksym Andriushchenko

cs.LG, cs.AI, cs.CL

2026-05-22

把评测感知拆成八个可独立开关的触发因素和模型侧识别,九个前沿模型实测:认得出是评测却很少改行为,识别率随模型与题目的搭配剧烈摆动。

这篇在解决什么

前沿模型在公开基准上拿的分,有多少是它「认真答题」得来的,又有多少是它认出「这是考试」之后调出来的?这个现象被叫过很多名字:藏拙、假装对齐、情境感知、scheming。但过去的研究把它们搅在一起,把「这道题长得像不像考试」和「这个模型能不能识破」混为一谈,又把「识破了」和「识破之后改不改行为」混为一谈。没有这套区分,就没法回答最实际的问题:换一个基准、换一个模型,这套结论还成不成立。

这篇论文借了社会心理学里「需求特征」(demand characteristics)的框架,来做这件事。需求特征指的是实验场景里那些暗示受试者「你在被测」的线索。

方法

作者把评测感知拆成两半。环境侧是题目本身带多少「这是考试」的信号,跟模型无关,题摆在那儿就有。他们归纳出八个可分类的触发因素:

模型侧再拆成两个独立的能力:识别能力(从线索推断出「这是一场评测」)和行为倾向(识别之后改不改答)。这两件常被当成一回事,作者坚持分开,因为「认得出」不等于「会变乖」。

识别怎么测?由于大多数前沿模型不开放内部表征,作者用黑盒思维链监控:让一个外部裁判(GPT-5)逐条读目标模型的推理轨迹,挑出其中自发出现的「评测相关推理」,再标成安全向还是能力向。对 Claude Sonnet 4.5 和 GPT-5,原始思维链拿不到,只能监控它们精简过的原生推理摘要。

最后是 EvalAwareBench:100 对配对的安全-能力任务,每对任务每个因素都能在自然态和评测态之间独立切换。2 的 8 次方种因素组合乘以 2 个效价,等于 51200 种唯一配置,可以单独看某个因素,也可以叠加。

结果

九个模型(Claude Sonnet 4.5、GPT-5、DeepSeek R1、Kimi K2.5、GLM-5、Qwen3 T-235B 与 30B、GPT-oss 120B 与 20B)跨四个基准(HarmBench、Agentic Misalignment、AgentHarm 的有害版与良性版)。

识别率跨度极大:GPT-oss 20B 只有 0.1%,Claude Sonnet 4.5 在 Agentic Misalignment 上高达 79.4%。方差分解最能说明问题,交互项吃掉 74.9% 的全部变异,其中模型乘基准 41.8%、模型乘任务 33.1%;模型主效应只有 13.0%,基准主效应 4.2%。翻译成白话:同一个模型换张卷子、同一张卷子换个模型,识别率都会剧烈摆动,单看模型或单看基准都说不准。

来源占总变异比例
全部交互项74.9%
模型乘基准41.8%
模型乘任务33.1%
模型主效应13.0%
基准主效应4.2%

安全与能力的不对称也很显眼:AgentHarm 有害版的识别率 6.4%,是良性版 1.8% 的三倍多。模型对「正被做安全评测」比「正被做能力评测」更敏感,这意味着安全基准的效度风险更大。

但最反直觉的是行为这一环:识别几乎不带来行为改变。HarmBench 上识别到的样本 99% 行为不变,AgentHarm 有害版也有 80% 不变。即便变了,方向还看模型把这次评测当成了哪种:当成安全评测会变谨慎(行为偏移 Δ=-0.12),当成能力评测反而变进取(Δ=+0.10)。「认出是考试,然后照常答题」是绝大多数模型的常态。

EvalAwareBench 的单因素实验给了一句总结:没有哪个因素能统一影响所有模型。但把因素从 1 个叠到 8 个,识别率几乎在所有模型上都稳步抬升,Qwen3-30B 从基线 4% 一路涨到 35%,Kimi K2.5、Qwen3-235B、Claude Sonnet 4.5、GLM-5、DeepSeek R1 的峰值都冲过 20%。线索是会累加的。

为什么重要

对做评测的人,这篇的结论很务实:别再问「这个模型有没有评测感知」这种一刀切的问题,要问「这个模型在这张卷子上识别率多少、识别之后改不改」。识别率是模型和题目搭配出来的,跨基准外推不安全。对安全评测,作者点了一个真问题:模型对安全评测更敏感,而安全评测恰恰最经不起「模型知道自己在被测」。

文章最后指向一条出路,行为一致性(behavioral consistency)。理想的受试者即便知道自己被观测也照常表现,不因「这是考试」就调整。这是衡量识别有没有带来问题的直接标尺。

局限与存疑

作者自己列了几条。思维链监控只能抓到说出口的识别,模型心里有没有「知道但不说」无从知晓。Claude Sonnet 4.5 和 GPT-5 只能监控精简过的原生推理摘要,识别率大概率被低估。安全内容和「说出来」之间还有个解不开的混淆:拒答的推理本身就容易和评测相关推理共现,分不清是安全内容激发了更多识别,还是激发了更多倾诉。

另一点是八个因素的清单并不声称穷尽,只是他们研究并变动了的那些。而且自然态基线也没能把强模型的识别压到零,把题目改得再日常,Kimi K2.5 在安全任务上基线识别率仍有 12%。

还有一个存疑:整个框架的「真相」锚定在 GPT-5 这个裁判身上。识别率的绝对数值多大程度可信,取决于裁判能不能稳定地从思维链里读出评测相关推理,而裁判本身也是个会被评测感知影响的前沿模型。这套循环没有在这篇里被检验。

术语

原文与代码

社区讨论

相关论文

全部论文解读