不标失败数据,3 层 MLP 定位 agent 出错步骤,胜过 GPT-5 还快五千倍

Tracing Agentic Failure from the Flow of Success

Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li

cs.AI, cs.CL

2026-07-14

只用 100 条成功轨迹训练单类 Neural CDE,按逐步异常分定位 agent 失败步骤,域内 F1 比 GPT-5 提示基线高 20 个点,推理零 token、快 200–5000 倍。

这篇在解决什么

Agent 系统跑挂一个长任务后,轨迹里可能有几十上百步,到底哪一步把任务带崩的?Who&When benchmark 的结论是,最先进的推理模型做这件事准确率不到 15%,人工排查一条轨迹要专家花数小时。已有两条路线都有硬伤:提示管道要在推理时跑前沿大模型,token 成本和延迟下不来;用 RL 后训练则需要给失败轨迹逐步标错误,这种标注贵且模糊,判断「改哪一步任务能救回来」依赖实际拿不到的纠错 oracle。

OAT 换了个设定:只在成功轨迹上训练,推理时给失败轨迹逐步打异常分。成功轨迹是系统正常运行免费产出的副产品,标注瓶颈直接消失。

方法

核心是把问题变成表征空间的单类学习:学好「正常流程长什么样」,偏离即异常。

结果

域内(MCP-Atlas,88 条失败轨迹,作者自标注):

方法F1Hit rate
GPT-4o0.2120.250
GPT-50.1810.250
OAT (top-k)0.4200.777
OAT (CP)0.4350.566

OOD(Who&When,184 条 GPT-4o 生成的多智能体轨迹):OAT top-k 拿到 F1 0.225、hit 0.451,GPT-5 是 0.152、0.275。AUROC 域内 0.629、OOD 0.758。

效率差距更夸张:OAT 推理约 7 毫秒、零输出 token、模型不到 1 GB 显存;GPT-4o 平均 4.2 秒,GPT-5 平均 39.6 秒、3012 个输出 token,量级差 200–5000 倍。

消融:换回 Neural ODE 或 RNN 一致变差;用 Llama-4-Scout、Gemma-4、GPT-oss-120B 当代理模型提表征只小幅掉点,不依赖生成模型的内部状态;取更深层(靠近输出端)的表征效果更好。

为什么重要

这是一条便宜到可以常开的失败诊断路线。提示管道每次诊断花几千 token、几十秒,只能事后抽查;OAT 训练只要 100 条成功轨迹、推理毫秒级,可以挂进生产系统实时跑,逐步异常分还能直接当监控信号。诚实地说,绝对值不算高:域内 F1 0.435 意味着它更适合当粗筛,把人最该读的几步排到前面,替代不了人读轨迹。

局限与存疑

作者自己承认的:模型容易漏掉推理文本里隐含的早期错误,「没有合适工具」这类陈述在成功轨迹里也会出现,单看表征不够异常;CP 的硬阈值会漏掉略低于阈值的因果步骤,案例研究里就有根因步骤差一点没过线的情况。

读下来还有几处要打折扣。数据规模很小:域内 103 成功加 88 失败,失败步骤是作者自己标的。基线偏弱:域内 random-step 的 F1 都有 0.255,高于 GPT-4o 和 GPT-5,提示基线在这个设置下本来就不灵,OAT 的相对优势有一部分来自基线塌了。OOD 结果的管线里还加了附录才交代的 CORAL 二阶统计对齐,拿掉之后剩多少没有单独报告。

术语

原文与代码

社区讨论

相关论文

全部论文解读