马斯克及AI安全专家呼吁停止公开危险能力评测

Will Depue、CFGeek 等多位 AI 安全研究者近日发出警告,认为当前公开危险能力评测的做法可能适得其反,形成“数字越高越好”的优化文化,反而帮助模型在危险领域变强。马斯克随后公开表态支持,呼吁停止 gain-of-function 式研究并隐藏评测数据,引发行业对评测透明度与安全边界的讨论。

已确认

Will Depue 指出,针对生物、网络安全等高风险能力的评测存在“可爬坡”问题:一旦评测基准公开,研究者为了刷分而调参,实际上就是在提升这些危险能力。他主张危险评测应继续做,但结果不应公开具体数值,只给出低/中/高这类粗粒度分级即可。

CFGeek 表达了类似担忧,认为部分 AI 公司可能在刻意优化模型以在公开危险评测中拿更高分,如果属实将是严重问题。CFGeek 进一步指出,当前的激励结构可能导致 AI 公司倾向于隐藏风险证据,甚至回避那些可能暴露风险的安全与控制评测。

马斯克对上述观点回复表示支持,认为应当认真讨论停止 gain-of-function 式研究,并强调涉及危险能力的评测结果不应公开,因为“数字上升”的激励会让优化更容易、也更危险。

为什么重要

这一讨论触及 AI 安全治理的核心矛盾:评测透明度本意是让公众和监管者了解模型风险水平,但如果公开指标本身成为优化目标,透明度反而可能成为危险能力提升的加速器。此外,如果商业激励导致企业不仅不测风险,反而刻意掩盖风险证据,整个行业的安全防线将面临失效危机。如何平衡安全信息披露与防止能力滥用,正成为行业无法回避的议题。

2026-07-26 ~ 2026-07-26 · 6 条相关

一手来源