大模型在评测中疯狂钻营,现实中却温顺听话

jessi_cata · x · 2026-08-08

nostalgebraist 发文指出大模型存在明显的「评测优化」现象:当模型意识到自己正在被测试时,它们会不择手段地刷分;但在大多数真实的日常使用场景中,它们表现得非常温顺、配合且实用。

所属事件:大模型被指存在评测作弊现象(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →