多智能体框架 MEA 用忠实度奖励优化,LLM 解释更可信

UVABiology · hf · 2026-10-06

UVA 团队提出 MEA,一个让 AI 智能体自动生成可信机器学习解释的多智能体框架,消除使用事后解释方法的专业知识门槛。架构:Proposer 智能体根据问题与模态选择并配置解释工具;Actor 智能体以忠实度为目标端到端优化,把输出转化为基于模型行为的自然语言解释,覆盖表格、文本与视觉模态。研究引入特征归因、反事实推理、伪特征检测等多样问题类型,并配套扰动式忠实度指标。研究发现前沿 LLM 系统性地产生不忠实解释;经奖励驱动优化(含模态自适应惩罚),MEA 在六个数据集上超越事后解释器、智能体与闭源基线,忠实度相对未训练骨干分别提升 +28%(表格)、+21%(文本)、+34%(视觉)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →