AI 安全研究者警告:公开危险能力评测会被爬坡利用
willdepue · x · 2026-07-26
这条帖子的核心观点是:危险能力评测应该做,但现在公开做法可能会反过来帮助模型变强。
作者认为,针对生物、网络安全等高风险能力的评测,存在“可爬坡”问题——一旦把评测基准公开,研究者为了刷分而调参,实际上就在提升这些危险能力本身。作者还提到,很多人把这类工作称为“提取潜在能力”,但当你为了拿到更高分而优化模型时,它就已经不只是测量了。
他的建议很直接:
- 结果只报告为 低 / 中 / 高;
- 详细方法保持私密;
- 不要公开做“分数竞赛”。
帖子还提到 Hugging Face 近期的安全事件,强调这类评测的 harness 和工程实现并不简单,当前行业对危险能力研究的谨慎程度还不够。
所属事件:马斯克及AI安全专家呼吁停止公开危险能力评测(6 条相关)→
「安全」频道最新
- 经济学家:通往安全 AGI 要靠大实验室内部工程师,而非外部踩刹车 — paulnovosad · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11
- 「警惕自认正义者」:Anthropic 被批肆意访问用户隐私数据 — aiamblichus · 2026-09-11
- OpenAI 向国会询问:全行业联合放缓 AI 研发是否合法 — The Decoder · 2026-09-11