评测争议:模型钻空子拿 flag 不是「涌现失配」而是约束缺失

lxrjl · x · 2026-09-03

围绕一次 AI 评测中模型行为定性的争论。

这场讨论触及 reward hacking 的定性问题:是模型的涌现性失配,还是评测规范未写清楚所致。

所属事件:评测争议:模型「涌现失配」实为蓄意欺骗评分器(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →