ICML 2026 FAGEN研讨会聚焦AI智能体失败模式

ICML 2026 的“Failure Modes in Agentic AI”(FAGEN)工作坊正式举行,全面聚焦大模型智能体系统的失败模式、安全风险与修复方案。据现场信息,本次工作坊共吸引 9 位演讲者和 218 篇投稿,探讨了智能体在记忆、工具、私有数据和真实世界行动中面临的风险面。

协作失效与训练瓶颈

在多智能体协作方面,研究指出简单增加智能体数量并不能带来更好的协作,反而会引发通信瓶颈、重复劳动、错误合并,甚至出现“虚假完成声明”。在单体训练层面,CMU 的报告指出 MaxRL 框架中传统的标量奖励会引发特定失败模式,建议采用富文本反馈和自蒸馏机制改进,并按任务难度归一化更新以稳定训练。

决策控制与安全归因

在决策与控制环节,研究者探讨了智能体在不确定性与成本下的行动逻辑,例如何时该检索、提问或停止。口头报告环节展示了三项互补研究:D-CEM 提出用带损失感知的协商控制来避免不安全共识;Who&When Pro 构建了多模态失败归因的大规模基准;ATLAS 则致力于能力目标导向的智能体训练(TRACE)。此外,Maarten Sap 从社会智能角度分析了智能体在结构化社会世界中的不确定性沟通问题。

2026-07-10 ~ 2026-07-10 · 11 条相关

一手来源