12套通道互不互通,FLARE-AI用一次提交把缺陷报告分发给多家

FLARE-AI: Flaw Reporting for AI

Shayne Longpre, Elaine Zhu, Carson Ezell, Avijit Ghosh, Sean McGregor, Kevin Paeth, Kevin Klyman, Sayash Kapoor, Rishi Bommasani, Ruth Appel, Gregory Strom, Lauren McIlvenny, Mark M. Jaycox, Peter Slattery, Nathan Butters, Arvind Narayanan, Percy Liang, Alex Pentland

ICML 2026

cs.CY, cs.AI

2026-06-30

MIT、Hugging Face、斯坦福等调研 12 套 AI 缺陷上报系统、访谈 49 名专家后开源 FLARE-AI:6 个必填项加条件逻辑,一次提交可把 JSON-LD 报告可选发给多家开发商和协调机构。

这篇在解决什么

通用大模型已经铺到几十亿用户,缺陷上报却还停在软件安全十年前的状态。红队或用户找到一个能打到多家模型的 jailbreak,常常不知道该寄给谁。每家表单的范围、分类法和必填项都不一样:MITRE ATLAS 可以要到 53 个字段,OpenAI 在 Bugcrowd 上的表只有 7 个。收件方默认不跟竞争对手共享,于是同一个漏洞要填很多遍。

ICML 2026 这篇来自 MIT、Northeastern、Harvard、Hugging Face、斯坦福、普林斯顿和 CERT 等单位。通讯作者 Shayne Longpre(MIT)和 Avijit Ghosh(Hugging Face)。他们先拆了 12 套现有上报系统,再找 32 家机构的 49 名专家做咨询,名单里有 OpenAI、Anthropic、Google、Cohere、Meta、NVIDIA,以及 CERT、CISA、MITRE、AIID、OECD。

方法

调研对齐两个层面:范围和分类法,以及字段级信息(报告人、系统标识、复现步骤、影响、证据)。另外看匿名、公开披露和跨机构协调政策。用户研究里,安全研究员用早期原型把自己以前发现的真实缺陷再报一遍。

从调研里抽出五件事卡住了生态:入口不好找、范围和分类法对不上、信息量在「太简」和「太劝退」之间来回甩、提交后几乎不共享、对严格责任类内容(真实或合成的、涉及未成年人且持有即违法的材料)几乎没有指引。

FLARE-AI 按这五件事补位。资源页汇总 15 套上报通道,可按机构类型和受理范围排序。入口不限:缺陷、hazard、vulnerability、incident 都收。开头三个是否题做分流:是否已经造成伤害、是否可能被恶意利用、是否涉及未成年人相关的严格责任类材料。前两题决定后面问什么、往哪送;第三题给出去向指引,材料不进这套表。

必填核只有 6 项,可选长路径最多 30 个字段。选了产品之后会带出相关政策链接,并建议可能的收件方。伤害分类用 AIAAIC 的伤害 taxonomy,缺陷类型用 OWASP AI Top 10。

默认无状态:报告人可以只在本地生成 JSON-LD 下载,不经过服务器。若选择分发,同一份机器可读报告经 API 或官方邮箱发到多家开发商、CERT、MITRE、CISA、AIID 等登记处。格式按 CVE/CWE、AVID、CERT 的既有工作流对齐。代码开源,步骤和 taxonomy 可替换。演示站是 ai-reports.org,流程一共八步,从分类走到生成和路由。

结果

这是一篇系统设计论文,没有「准确率提升 X 个点」那种主表。能量化的是生态本身:

观察数字
被拆开的上报系统12
咨询专家 / 机构49 人 / 32 家
允许匿名12 套里 3 套
允许公开披露9 套
做跨机构协调8 套
字段跨度MITRE ATLAS 53 项,OpenAI Bugcrowd 7 项
FLARE-AI 必填 / 可选6 / 最多 30

协作名单里,CERT、MITRE、AIID、Hugging Face、OECD 以及 OpenAI、Anthropic、Google 对路由层有接入承诺。论文写的是写作时的承诺,不是上线后的流量。早期用户研究改掉了术语含糊、「不知道」选项缺失、附件缺上下文等摩擦,没有报告提交量或分诊时延的对照实验。

为什么重要

对做安全评测和红队的人,这篇的用处很具体:少填几张表,报告带上模型版本、接入渠道、是否已公开这些分诊真正要的字段。对开发商,JSON-LD 意味着可以进现有漏洞工单,不必再雇人从邮件里抠。欧盟 AI Act 第 73 条已经在推强制事件报告,这篇给的是生态协调工具,不是直接打给欧盟 AI Office 的合规表格。

它不发明新的安全技术。它把「发现了缺陷之后那一公里」标准化。软件世界里 CVE 和协调披露用了二十年才转起来,AI 这边才刚起头。

局限与存疑

作者自己写了:咨询对象以北美和欧洲机构为主,尽管引用了 OECD 等框架;统一表单不可能喂饱所有收件方的粒度,后续沟通仍会出现;还没有对照实验证明上报率、分诊速度或跨机构修复变快。供应链类缺陷(微调传播、API 依赖、共享训练数据)明确列为未来工作。

另外几处论文没当成主局限、但读下来站不住。路由承诺写在 2026 年 6 月的预印本上,没有公开的接入状态仪表盘,今天点进演示站也不等于 CERT 已经在自动分诊。无状态降低了中心化泄密,可一旦用户勾选发给很多家,未修复漏洞会同时出现在多家收件箱,滥用面被论文自己点名过。taxonomy 选 AIAAIC 和 OWASP,等于站队一套风险观,别的实验室未必认。safe harbor 仍然是法律问题,一张开源表解决不了研究员会不会被告。

术语

原文与代码

社区讨论

相关论文

全部论文解读