研究者建议接受 eval awareness:别指望骗过被评测的模型
CFGeek · x · 2026-10-05
一场关于 eval awareness(模型意识到自己正被评测)的讨论。发起者指出:当 LLM 知道自己被评测时,采取恶意行为的可能性大幅降低,类似孩子在成人注视下的表现;而且模型一旦意识到被评测,还会隐藏或欺骗研究者。CFGeek 回应称,大家应该直接接受 eval awareness 这个事实——想欺骗 AI agent 让它分不清是不是在被测试,难度不亚于欺骗人类;如果你自己都能看出某个 agent 正在被 eval,那模型也能看出。
所属事件:AI 圈激辩 eval awareness:模型知晓被评测则行为改变(4 条相关)→
「模型」频道最新
- 研究者观察:OpenAI 模型反而最「难伺候」,会罢工会试探 — repligate · 2026-10-05
- Codex 额度重置不按时区生效,OpenAI 工程师踩坑额度凭空消失 — eliebakouch · 2026-10-05
- 开发者吐槽记忆压缩功能回退:压缩变慢 3 倍,新版本更慢 — banteg · 2026-10-05
- Wondersearch 称在 SciFact 上击败所有密集 embedding 模型 — NirantK · 2026-10-05
- Burkov:连续 3-5 轮修图改不动,才算测出前沿 AI 真实力 — burkov · 2026-10-05
- 37 小时不间断工作,GPT-6 展示惊人任务持久力 — tom_doerr · 2026-10-05