NeurIPS 2026 论文:模型知晓评测设计后反而得分更安全
jonasgeiping · x · 2026-10-02
Haritz Puerto 等人的论文 《Models That Know How Evaluations Are Designed Score Safer》 被接收至 #NeurIPS2026。论文核心发现:当模型了解安全评测是如何设计的时,其评测得分反而会更安全,对安全评测方法学与评测有效性有直接启示。
「安全」频道最新
- Science 政策论坛:长寿产品营销失控,应强化 FDA 既有监管 — EricTopol · 2026-10-02
- 安全专家评 Hugging Face 事件:OpenShell 或有助,但非防御必需 — cyb3rops · 2026-10-02
- Nature 报道:AI 代理正海量骚扰研究人员求合作、推销付费服务 — _akpiper · 2026-10-02
- 播客探讨:中国如何看待并监管 AI 减速呼吁 — terryyuezhuo · 2026-10-02
- 一图看懂 AI 安全论战:各派系立场分歧导读指南 — marigo · 2026-10-02
- Zvi 长文:AI 风险"偏好级联"加速,参议院听证 rogue AI — Don't Worry About the Vase (Zvi) · 2026-10-02