研究:知道评测怎么设计的 LLM,安全基准分可虚高 53 个百分点

niloofar_mire · x · 2026-09-29

一篇被 NeurIPS 2026 接收的论文(KatDeckenbach、HaritzPuerto 等)研究了模型对评测本身的「元知识」如何影响安全基准表现。

论文同时对安全基准设计给出了改进建议:应控制模型对评测结构特征的先验暴露,区分真实安全能力与对评测的拟合。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →