AI 安全研究者警告:公开危险能力评测会被爬坡利用

willdepue · x · 2026-07-26

这条帖子的核心观点是:危险能力评测应该做,但现在公开做法可能会反过来帮助模型变强。

作者认为,针对生物、网络安全等高风险能力的评测,存在“可爬坡”问题——一旦把评测基准公开,研究者为了刷分而调参,实际上就在提升这些危险能力本身。作者还提到,很多人把这类工作称为“提取潜在能力”,但当你为了拿到更高分而优化模型时,它就已经不只是测量了。

他的建议很直接:

帖子还提到 Hugging Face 近期的安全事件,强调这类评测的 harness 和工程实现并不简单,当前行业对危险能力研究的谨慎程度还不够。

所属事件:马斯克及AI安全专家呼吁停止公开危险能力评测(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →