LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures
Yunfei Zhang, Boyu Feng, Changhua Pei, Zexin Wang, Zhihuang Peng, Xinlong Liu, Hengyue Jiang, Difeng Ma, Jiayi Zhang, Yongzhou Yao, Yanan Zhao, Fei Sun, Yintong Huo, Zhaoyang Liu, Jingjing Li, Gaogang Xie, Dan Pei
cs.AI, cs.SE
2026-08-15
LongRCA Bench收了1140条自然失败的长轨迹,中位145步,根因到结尾中位再隔48步。无训练的RCTA角色准确率51.1%、精确根因步24.1%,最强基线ECHO只有27.5%与13.2%。
长程 agent 失败之后,评测器只告诉你没做成。开发者要在几百步日志里回答两件独立的事:哪个角色该负责,最早引入不可修复错误的是哪一步。现有归因基准大多更短。Who&When 平均 22.2 步;Who&When Pro 靠注入错误,平均 7.5 步;RootSE 平均 50.9 步。中位 145 步、根因后面还跟着几十到几百步的自然失败,几乎没人评。
SWE-bench Pro 里有一条典型轨迹。第 37 步 DiagnostAgent 交出一份用错 API 的修复计划,执行器照做,第 163 步报完成,47 个必过测试 0 个通过。责任在诊断角色和第 37 步,不在后面那 126 步执行。
LongRCA Bench 收了 1140 条评测器确认失败的自然轨迹,不注入错误。来源是 SWE-bench Pro 128 条、Terminal-Bench 2 42 条、TravelPlanner 685 条、VitaBench 108 条、WebArena Verified 177 条。生成模型是 MiniMax-M2.5、Kimi-K2.5、Qwen3.5-Plus。异构日志压成统一的 0 起始步、角色名、原文。
22 名计算机研究生标注。先 100 条校准,再全量;全量 1444 条标注覆盖 1100 条轨迹,一条要 30–40 分钟。角色必须在轨迹里出现,不必是根因步的发送者。根因是最早引入、且到失败仍未修好的那一步。交接指令里已经带错,根因算指令步。冗余子集上精确一致率:角色 65.9%,根因步 39.5%,联合 38.4%。步一致卡得很死,差一步就算不同意。
RCTA 无训练。轨迹按字符和步数切段,可对齐交接或完成标记,段边界重叠最多 5 步。每段一次模型调用出摘要和候选错误步;相邻摘要合成子目标大纲;对执行器、校验器候选回溯最近一条写给该角色的交接指令,其他候选取最近交接当计划上下文。终判只看原始日志:指令里已经有错且后步照做,根因是指令;后步偏离或另引入新错,根因是后步。角色和步分字段输出,程序校验角色在轨迹中、步号合法、引用的交接原文确实出现。非法输出重试一次。
对照全部用 DeepSeek-V4-Flash:一次性读完全程、逐步扫描、二分搜索、ECHO、FALAT。
1140 条合计 178137 步,平均 156.3,中位 145,最长 728。根因中位在第 55 步,根因到结尾中位 48 步,P90 是 183,最大 605。49.0% 的轨迹根因后还有超过 50 步,28.4% 超过 100 步。TravelPlanner 占 60.1%,来源并不均衡。
| 方法 | 角色准确率 | 精确根因步 | ±5 步 | MAE |
| All-at-once | 26.2% | 7.6% | 19.9% | 55.9 |
| Step-by-step | 22.2% | 5.3% | 16.9% | 52.3 |
| Binary search | 23.0% | 3.4% | 13.3% | 61.7 |
| ECHO | 27.5% | 13.2% | 24.7% | 50.4 |
| FALAT | 19.0% | 2.8% | 12.5% | 66.6 |
| RCTA | 51.1% | 24.1% | 37.4% | 38.6 |
相对最强基线 ECHO,三角分别高 23.6、10.9、12.7 个百分点。精确根因步仍只有四分之一:角色好找,步难钉。按长度分层,RCTA 在不超过 100 步时 30.3%,101–200 步 20.3%,201–400 步 20.2%;超过 400 步是 31.0%,但只有 42 条且来源构成不同,不能当成更长更容易。根因到结尾的分箱也非单调。论文写明这是描述性分层,不是因果效应。
线上 agent 已经在写几百步日志,失败归因如果还用 20 步基准,测的是另一件事。把角色和根因步拆开打分是对的:角色 51% 会掩盖步定位只有 24%。RCTA 的用法很工程:先摘要缩小候选,再拿原始交接文本对质,不把摘要当证据。对做 agent 评测和事后分析的人,这是目前较长、全人工标注、非注入的失败归因集。
24.1% 说明这活远没做完。人类自己对精确步的一致率也只有 39.5%,标签噪声和方法上限缠在一起。
TravelPlanner 一家独大 60%。没有 RCTA 组件消融,候选召回、交接回溯、校验各贡献多少不清楚。所有方法共用 DeepSeek-V4-Flash,换更强骨干绝对数字会变,相对排序不一定。离线、失败已经结束之后才诊断,不能外推成早期预警。不评完整因果链。长度和距离分层跟来源、工作流缠在一起。FALAT 在此协议下很差,论文也写了这不代表依赖分析方法整体不行。