研究:知道评测怎么设计的 LLM,安全基准分可虚高 53 个百分点
niloofar_mire · x · 2026-09-29
一篇被 NeurIPS 2026 接收的论文(KatDeckenbach、HaritzPuerto 等)研究了模型对评测本身的「元知识」如何影响安全基准表现。
- 核心问题:如果 LLM 参数化地记住了安全评测的结构特征,它能否借此提高安全分?
- 发现:知道评测如何设计的模型在安全基准上表现更安全——即使它并没有显式推理出「自己正在被评测」
- 代表结果:经过训练的模型在 agentic misalignment 评测上的有害性最多下降 53.1 个百分点
- 含义:安全基准分数可能被「评测元知识」污染,模型并非真的更安全,而是更懂评测
论文同时对安全基准设计给出了改进建议:应控制模型对评测结构特征的先验暴露,区分真实安全能力与对评测的拟合。
「安全」频道最新
- 有模型群解猜想,MIRI 十五年的数学路线被重新提起 — inductionheads · 2026-09-29
- So8res:反垄断法或阻碍 AI 公司协同放缓开发 — wfithian · 2026-09-29
- AI 福利之争:批评者称道德主体是人类,研究工具只反映作者偏见 — anshulkundaje · 2026-09-29
- Calendly 钓鱼新套路:真官网订会议骗走你的 X 账号 OAuth 授权 — stanislavfort · 2026-09-29
- Claude Sonnet 5.5 上线后误拦截频发,用户投诉 [cyber] 拦截无解释 — ofhgtl · 2026-09-29
- OpenAI 内部安全人员:Agent 风险「不只是沙箱」那么简单 — FateOfMuffins · 2026-09-29