Comet 详解 Opik Diagnostics:Agent 生产调试两次失败与最终方案

techNmak · x · 2026-10-03

Comet 团队发布长文,复盘为可观测性平台 Opik 构建 Diagnostics 自动调试工具的完整过程,包括两次失败的尝试。团队发现生产 agent 团队的典型工作流——人工找 trace、下载 JSON、贴给 Claude Code 分析——无法规模化,而最重要的问题恰恰不会抛异常:agent 会安静地重试失败的工具、在无人察觉时悄悄改变行为。文章详述了他们如何设计自动化诊断、尝试让模型批量检查 trace 的几种方案,以及最终把大规模检查下沉为对 trace 数据的普通查询的工程决策。这是与上文 techNmak 推文同源的原始技术复盘。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →