评测失真,往往是提示词教会模型知道自己在考试

secemp9 · x · 2026-07-22

评测之所以失真,是模型学会了“这是考试”这个信号

这条帖的核心观点是:很多 benchmark 失败,并不只是因为模型“提到了自己在做评测”,而是因为它学到了相关性偏差。

这是一条关于 如何设计更可信评测 的方法论讨论。

所属事件:研究者探讨 AI 评测设计:需具备模型同理心(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →