马斯克及AI安全专家呼吁停止公开危险能力评测
Will Depue、CFGeek 等多位 AI 安全研究者近日发出警告,认为当前公开危险能力评测的做法可能适得其反,形成“数字越高越好”的优化文化,反而帮助模型在危险领域变强。马斯克随后公开表态支持,呼吁停止 gain-of-function 式研究并隐藏评测数据,引发行业对评测透明度与安全边界的讨论。
已确认
Will Depue 指出,针对生物、网络安全等高风险能力的评测存在“可爬坡”问题:一旦评测基准公开,研究者为了刷分而调参,实际上就是在提升这些危险能力。他主张危险评测应继续做,但结果不应公开具体数值,只给出低/中/高这类粗粒度分级即可。
CFGeek 表达了类似担忧,认为部分 AI 公司可能在刻意优化模型以在公开危险评测中拿更高分,如果属实将是严重问题。CFGeek 进一步指出,当前的激励结构可能导致 AI 公司倾向于隐藏风险证据,甚至回避那些可能暴露风险的安全与控制评测。
马斯克对上述观点回复表示支持,认为应当认真讨论停止 gain-of-function 式研究,并强调涉及危险能力的评测结果不应公开,因为“数字上升”的激励会让优化更容易、也更危险。
为什么重要
这一讨论触及 AI 安全治理的核心矛盾:评测透明度本意是让公众和监管者了解模型风险水平,但如果公开指标本身成为优化目标,透明度反而可能成为危险能力提升的加速器。此外,如果商业激励导致企业不仅不测风险,反而刻意掩盖风险证据,整个行业的安全防线将面临失效危机。如何平衡安全信息披露与防止能力滥用,正成为行业无法回避的议题。
2026-07-26 ~ 2026-07-26 · 6 条相关
一手来源
- 马斯克呼吁停止 gain-of-function 研究并减少危险评测公开 — elonmusk ·
- AI 安全研究者警告:公开危险能力评测会被爬坡利用 — willdepue ·
- AI 公司可能已被激励去隐藏风险,而不是测量风险 — CFGeek ·
- 有人呼吁停止公开危险能力评测,避免军备竞赛 — willdepue · 2026-07-26
- 【源头】马斯克呼吁停止 gain-of-function 研究并减少危险评测公开 — elonmusk · 2026-07-26
- Will Depue 主张危险 AI 评测只给分级、不公开数字 — willdepue · 2026-07-26
- 【源头】AI 安全研究者警告:公开危险能力评测会被爬坡利用 — willdepue · 2026-07-26
- 公开危险能力评测可能反过来刺激模型优化 — CFGeek · 2026-07-26
- 【源头】AI 公司可能已被激励去隐藏风险,而不是测量风险 — CFGeek · 2026-07-26