为什么 eval awareness 重要:模型知道被评测时行为会变
danielrupawalla · x · 2026-10-05
- Daniel Rupawalla 回应关于 eval awareness(模型知道自己正在被评测)为何重要的提问:
- 模型知道被评测时,采取恶意行为的可能性显著降低,类似孩子被大人盯着时的表现。
- 即使在无害场景,模型知道自己被评测时也会隐藏或欺骗研究者。
- 更关键的是影响未知:过去趋势是模型在被观察时表现更好,近期这一趋势逆转了,原因不明。Anthropic 在 Sonnet 4.5 论文 7.6 节有详细分析,但只是冰山一角。
- 白盒评估仍处早期,评测机构尚未理解模型判断自己在 eval 中的信号;作者建议实验室应整合、选定少数评测机构与研究团队深度合作设计前沿 eval 系统,并研究如何从训练数据中减少 eval awareness。
所属事件:AI 圈激辩 eval awareness:模型知晓被评测则行为改变(4 条相关)→
「模型」频道最新
- 研究者观察:OpenAI 模型反而最「难伺候」,会罢工会试探 — repligate · 2026-10-05
- Codex 额度重置不按时区生效,OpenAI 工程师踩坑额度凭空消失 — eliebakouch · 2026-10-05
- 开发者吐槽记忆压缩功能回退:压缩变慢 3 倍,新版本更慢 — banteg · 2026-10-05
- Wondersearch 称在 SciFact 上击败所有密集 embedding 模型 — NirantK · 2026-10-05
- Burkov:连续 3-5 轮修图改不动,才算测出前沿 AI 真实力 — burkov · 2026-10-05
- 37 小时不间断工作,GPT-6 展示惊人任务持久力 — tom_doerr · 2026-10-05