评测失真,往往是提示词教会模型知道自己在考试
secemp9 · x · 2026-07-22
评测之所以失真,是模型学会了“这是考试”这个信号
这条帖的核心观点是:很多 benchmark 失败,并不只是因为模型“提到了自己在做评测”,而是因为它学到了相关性偏差。
- 一旦提示词暗示“现在在评测”,模型就可能切换到一种特殊的 role-play 式乖巧模式。
- 这种行为很脆弱,到了真实使用场景里往往无法泛化。
- 作者建议把评测分成三类:neutral、negative(eval-awareness)和 positive(eval-obliviousness)。
- 真正要避免的,是让模型因为识别出测试环境,就表现出和日常使用不同的行为。
这是一条关于 如何设计更可信评测 的方法论讨论。
所属事件:研究者探讨 AI 评测设计:需具备模型同理心(3 条相关)→
「研究」频道最新
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- ARC AGI 3 应该保持私有,不该公开示例和数据集 — flowersslop · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- 5090 本地测试:80k 上下文下 Qwen Q6 速度掉到 15 tok/s — LFAdvice7984 · 2026-07-27
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27