From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents
Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun
cs.CL, cs.AI
2026-08-17
中科院软件所提出 RUPA,把 agent 执行历史建成有向依赖图并在图上传播不确定性,在 τ-2、Terminal-Bench-2、GAIA 三个基准 6 个开源模型上,失败预测 AUROC 全面超过现有不确定性量化方法。
Agent 跑长任务时,什么时候该相信它、什么时候该人工接管,是个还没解决好的问题。现有做法主要看模型自己的信号:token 概率、预测熵、或者让模型口头报一个置信度。作者先做了一组摸底实验,结论很不客气:在 τ-2 的 Airline 域,序列概率做轨迹级失败预测的 AUROC 只有 0.205(比瞎猜 0.5 还差),口头置信度 0.485,约等于瞎猜。
问题出在哪。Agent 的失败很少来自单步预测错,而是错误在相互依赖的步骤间累积:一个早期误解当时看不出影响,后面每一步都建立在它之上,最终酿成整条轨迹失败。作者统计了失败轨迹里风险最高步的位置,发现这些步均匀分布在整个执行过程,并不集中在末尾;失败步平均重复度 0.981、停滞度 0.883。也就是说,失败信号藏在轨迹的结构关系里,线性序列 + 局部置信度这套表示根本装不下它。
RUPA(Relational Uncertainty Propagation for Agents)的核心是把执行轨迹从序列改写成图,再让不确定性沿边流动。
图的构建是确定性的规则匹配:节点是执行事件(用户指令、推理或动作、工具调用、环境观察),边分七种关系类型:sequential(上一步)、latest(最近的环境或用户输入)、repetition(高度相似的重复动作)、progression(延续已有解题步骤)、parallel(同一任务下的备选分支)、feedback(环境报错、空返回、冲突反馈)、goal alignment(当前步骤与原始任务目标的语义关联)。边的判定靠 embedding 距离(bge-m3)加词面线索匹配,比如 progression 看 next、therefore、verify 这类续写词,feedback 看 traceback、error、timeout 这类报错词。全程不碰未来信息和最终标签。
传播机制三步:
关键设计是把关系类型的不对称性显式建模出来。重复(feedback 之外的重复动作)和反馈类边在失败轨迹里结构变异最大,拿到的传播权重也最大;与失败无关的分支传播过来的不确定性则被自然抑制。换成随机拓扑的图做消融,效果直接掉回基线,说明涨点来自真实的依赖结构,不是「多加了个图」。
三个基准:τ-2(对话式决策)、Terminal-Bench-2(终端软件工程)、GAIA(开放域复杂问题),6 个开源模型 26B 到 230B。失败预测的 AUROC:
| 模型 | 最强基线 | RUPA |
| Qwen3.5-27B | 0.608(Tracer) | 0.656 |
| Qwen3.6-35B | 0.629(Tracer) | 0.645 |
| Gemma4-26B | 0.761(SAUP) | 0.780 |
| Gemma4-31B | 0.842(SAUP) | 0.861 |
| MiniMax-M2.7 | 0.694(Tracer) | 0.718 |
| GPT-OSS-120B | 0.567(UProp) | 0.577 |
三个实际应用场景:
Agent 量产部署卡在可靠性上,「报一个可信的风险分」比「再提五个点成功率」在不少场景更急用:高风控写入人工、低风险自动放行、中途预算止损,都依赖这个分。RUPA 的优势是不改模型、不加训练,推理侧即插即用;规则化的图构建意味着接入成本主要是日志结构化。对做 agent 平台的人来说,这套「轨迹结构化 + 关系加权传播」的思路可以直接搬到自己的风控模块里当特征工程,哪怕不全套照搬。
局限之内要说清:涨点是 2 到 4 个 AUROC 点,是渐进改进,方法论贡献(从序列到关系)大于绝对数字。GPT-OSS-120B 上 0.577 这个绝对水平,离生产可用的风险判断还有距离。
论文自述的与实测发现的: