Agent 调试陷阱:单条 trace 很有说服力,但统计才知道问题多大

techNmak · x · 2026-10-03

一条坏掉的 agent trace 往往极具说服力:重复调用同一工具、传错参数、五秒的活干了三十秒——你很容易以为找到了必须修的问题。但作者指出,trace 只能告诉你单次执行发生了什么,无法告诉你这类行为在全系统有多常见:可能是半年才出现两次,也可能五次运行就有一次,两者的工程优先级完全不同。

作者批评了当下流行的做法——让另一个 LLM 读大量 trace 做总结(trace 太多就换更便宜的模型)。其实一旦你知道要找什么,剩下的问题都是普通的数据问题:发生频率多高?涉及哪个工具?从什么时候开始?是否集中在某类请求上?这些用普通查询统计就能回答——数失败次数、分组、挑几个代表样本,需要解读时再让 LLM 上场。这一思路来自 Cometml 关于生产环境 agent 诊断的文章:他们尝试了多种让模型检查大量 trace 的方法,最终把大规模检查转移成了对 trace 数据的普通查询。

作者也承认局限:agent 可能执行干净但答案很糟,这类失败没有信号时统计无能为力,仍需评测和人工细读 trace。核心教训是:知道要找什么之后,不需要 LLM 来帮你数数。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →