Agent 调试陷阱:单条 trace 很有说服力,但统计才知道问题多大
techNmak · x · 2026-10-03
一条坏掉的 agent trace 往往极具说服力:重复调用同一工具、传错参数、五秒的活干了三十秒——你很容易以为找到了必须修的问题。但作者指出,trace 只能告诉你单次执行发生了什么,无法告诉你这类行为在全系统有多常见:可能是半年才出现两次,也可能五次运行就有一次,两者的工程优先级完全不同。
作者批评了当下流行的做法——让另一个 LLM 读大量 trace 做总结(trace 太多就换更便宜的模型)。其实一旦你知道要找什么,剩下的问题都是普通的数据问题:发生频率多高?涉及哪个工具?从什么时候开始?是否集中在某类请求上?这些用普通查询统计就能回答——数失败次数、分组、挑几个代表样本,需要解读时再让 LLM 上场。这一思路来自 Cometml 关于生产环境 agent 诊断的文章:他们尝试了多种让模型检查大量 trace 的方法,最终把大规模检查转移成了对 trace 数据的普通查询。
作者也承认局限:agent 可能执行干净但答案很糟,这类失败没有信号时统计无能为力,仍需评测和人工细读 trace。核心教训是:知道要找什么之后,不需要 LLM 来帮你数数。
「编程与Agent」频道最新
- 纽约 Agentic AI 聚会将复盘九月动态并演示 PowerShell 决策工作流 — dfinke · 2026-10-03
- sindresorhus:别让 AI 当 PR 路由,开源该让项目 AI 直接吸收贡献 — vykthur · 2026-10-03
- 从单轮对话到指挥 agent 团队:Every 运营负责人的五个提示词 — danshipper · 2026-10-03
- AI 工程更像立法而非打游戏:规则需随现实不断修正 — danshipper · 2026-10-03
- Claude Code 让人变笨?反驳者:把判断也自动化才是问题 — aakashgupta · 2026-10-03
- Winnipeg 城市 MCP Server 上线,AI 助手可查公交与市政服务 — modelcontextprotocol · 2026-10-03