Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration
Yuxiang He, Jian Zhao, Yuchen Yuan, Tianle Zhang, Wei Cai, Haojie Cheng, Ziyan Shi, Ming Zhu, Haichuan Tang, Chi Zhang, Xuelong Li
cs.AI
2025-12-02
五个 agent 两轮辩论做多模态内容审核,Aetheria 在 AIR-Bench 多模态任务 F1 0.84,超过开源最优 0.75,商业 API(Azure)仅 0.50。
内容审核有三个老问题。基于关键词和规则的方案读不懂上下文,抓不住隐含风险。基于深度学习的分类器(Llama Guard、ShieldGemma 这类)是黑盒,判了违规却说不清为什么,还带着单一模型的偏见和幻觉。商业 API(Azure Content Safety、OpenAI Moderation)处理纯文本还行,一到图文混合就拉胯。
Aetheria(中国电信 TeleAI 等,2025 年 12 月 arXiv)想补的空缺是:一个在多模态上更准、同时还能给出可解释、可审计推理过程的安全审核系统。它的目标场景明确不是毫秒级的初筛,而是高风险的二审和申诉复核,这种地方要的是能讲清楚一次封禁决定的理由,响应快慢是次要的。
核心是五个专门化 agent 加一个 RAG 记忆组件,跑两轮辩论:
辩论跑两轮,失败的案例由 Curator 做事后剖析,提炼成「关键线索」写回记忆库,形成持续学习。一个刻意的设计是异构模型组合:五个 agent 不全用同一个模型,消融实验证明全用 GPT-4o 反而更差。
在 AIR-Bench(3,274 个样本,覆盖文本、图像、多模态)上:
| 任务 | Aetheria F1 | 最强开源基线 | Azure |
| 纯文本 | 0.92 | ShieldGemma-9B 0.90 | 0.55 |
| 纯图像 | 0.87 | ShieldGemma-9B 0.82 | 0.25 |
| 文本+图像 | 0.84 | ShieldGemma-2B 0.75 | 0.50 |
商业 API 在多模态上的惨烈是这条结果里最刺眼的部分:Azure 只有 0.50,召回率 0.40,基本等于漏掉一半违规。
消融(多模态 F1)讲清楚了每个组件的价值:完整版 0.84;去掉 RAG 检索降到 0.80;去掉支持者 agent 降到 0.79;只留裁决者、不辩论,直接掉到 0.70。异构性也成立:五个 agent 全换成 GPT-4o,纯图像 F1 从 0.87 跌到 0.75。辩论轮数上,从一轮到两轮,精确率从 0.820 升到 0.828,F1 基本持平,时间只多 7.6%,两轮是甜点。
持续学习在难批次上见效:当无记忆基线在一个硬批次掉到 0.8252 时,带记忆的版本能拉到 0.8708。
实用层面,这是一个可解释、可审计的审核层:多模态比开源分类器准,而且能把自己的推理链摊开来看。它适合的是高风险的二审和申诉场景,那里要的是能解释一次封禁决定。
设计上的可借鉴之处是异构多智能体辩论(严辩对宽辩的对抗结构)加 RAG 先例记忆这套组合,同时改善了准确率和可解释性,这是个能搬走的模式。
要诚实的是它的定位:它是工程和系统层面的贡献(在现成 VLM 和 LLM 之上做 agent 编排),不是新基座模型。成本不低,平均一条要 6.88 秒、好几次模型调用。而且在纯文本上,它相对最强开源基线(ShieldGemma-9B)的提升很小(0.92 对 0.90),真正的优势集中在多模态和可解释性这两块。
平均一条 6.88 秒,离实时初筛的要求差得远,只能定位在二审。只在一个基准(AIR-Bench,3,274 个样本)上做了评估,换语料、换语言、换对抗分布的泛化没有验证。
成本这块缺一个完整的规模化分析:多 agent 加 VLM 加 RAG,每条要烧好几次 API 调用,论文没给全量成本和吞吐。纯文本相对开源最强基线提升很小,头条优势其实集中在多模态和可解释性。
持续学习的结果来自一个小规模序列实验(4 批 × 250),记忆到底是真泛化还是只是对已索引案例过拟合,没有充分压测。异构模型这个假设还会增加运维复杂度:你得同时跑和维护好几个模型,消融显示同构会变差,但论文没深究为什么。