NeurIPS 2026 论文:模型知晓评测设计后反而得分更安全

jonasgeiping · x · 2026-10-02

Haritz Puerto 等人的论文 《Models That Know How Evaluations Are Designed Score Safer》 被接收至 #NeurIPS2026。论文核心发现:当模型了解安全评测是如何设计的时,其评测得分反而会更安全,对安全评测方法学与评测有效性有直接启示。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →