把 agent 执行轨迹画成图再传播不确定性,失败预测 AUROC 平均涨 2 到 4 个点

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

cs.CL, cs.AI

2026-08-17

中科院软件所提出 RUPA,把 agent 执行历史建成有向依赖图并在图上传播不确定性,在 τ-2、Terminal-Bench-2、GAIA 三个基准 6 个开源模型上,失败预测 AUROC 全面超过现有不确定性量化方法。

这篇在解决什么

Agent 跑长任务时,什么时候该相信它、什么时候该人工接管,是个还没解决好的问题。现有做法主要看模型自己的信号:token 概率、预测熵、或者让模型口头报一个置信度。作者先做了一组摸底实验,结论很不客气:在 τ-2 的 Airline 域,序列概率做轨迹级失败预测的 AUROC 只有 0.205(比瞎猜 0.5 还差),口头置信度 0.485,约等于瞎猜。

问题出在哪。Agent 的失败很少来自单步预测错,而是错误在相互依赖的步骤间累积:一个早期误解当时看不出影响,后面每一步都建立在它之上,最终酿成整条轨迹失败。作者统计了失败轨迹里风险最高步的位置,发现这些步均匀分布在整个执行过程,并不集中在末尾;失败步平均重复度 0.981、停滞度 0.883。也就是说,失败信号藏在轨迹的结构关系里,线性序列 + 局部置信度这套表示根本装不下它。

方法

RUPA(Relational Uncertainty Propagation for Agents)的核心是把执行轨迹从序列改写成图,再让不确定性沿边流动。

图的构建是确定性的规则匹配:节点是执行事件(用户指令、推理或动作、工具调用、环境观察),边分七种关系类型:sequential(上一步)、latest(最近的环境或用户输入)、repetition(高度相似的重复动作)、progression(延续已有解题步骤)、parallel(同一任务下的备选分支)、feedback(环境报错、空返回、冲突反馈)、goal alignment(当前步骤与原始任务目标的语义关联)。边的判定靠 embedding 距离(bge-m3)加词面线索匹配,比如 progression 看 next、therefore、verify 这类续写词,feedback 看 traceback、error、timeout 这类报错词。全程不碰未来信息和最终标签。

传播机制三步:

关键设计是把关系类型的不对称性显式建模出来。重复(feedback 之外的重复动作)和反馈类边在失败轨迹里结构变异最大,拿到的传播权重也最大;与失败无关的分支传播过来的不确定性则被自然抑制。换成随机拓扑的图做消融,效果直接掉回基线,说明涨点来自真实的依赖结构,不是「多加了个图」。

结果

三个基准:τ-2(对话式决策)、Terminal-Bench-2(终端软件工程)、GAIA(开放域复杂问题),6 个开源模型 26B 到 230B。失败预测的 AUROC:

模型最强基线RUPA
Qwen3.5-27B0.608(Tracer)0.656
Qwen3.6-35B0.629(Tracer)0.645
Gemma4-26B0.761(SAUP)0.780
Gemma4-31B0.842(SAUP)0.861
MiniMax-M2.70.694(Tracer)0.718
GPT-OSS-120B0.567(UProp)0.577

三个实际应用场景:

为什么重要

Agent 量产部署卡在可靠性上,「报一个可信的风险分」比「再提五个点成功率」在不少场景更急用:高风控写入人工、低风险自动放行、中途预算止损,都依赖这个分。RUPA 的优势是不改模型、不加训练,推理侧即插即用;规则化的图构建意味着接入成本主要是日志结构化。对做 agent 平台的人来说,这套「轨迹结构化 + 关系加权传播」的思路可以直接搬到自己的风控模块里当特征工程,哪怕不全套照搬。

局限之内要说清:涨点是 2 到 4 个 AUROC 点,是渐进改进,方法论贡献(从序列到关系)大于绝对数字。GPT-OSS-120B 上 0.577 这个绝对水平,离生产可用的风险判断还有距离。

局限与存疑

论文自述的与实测发现的:

术语

原文与代码

相关论文

全部论文解读