Comet 详解 Opik Diagnostics:Agent 生产调试两次失败与最终方案
techNmak · x · 2026-10-03
Comet 团队发布长文,复盘为可观测性平台 Opik 构建 Diagnostics 自动调试工具的完整过程,包括两次失败的尝试。团队发现生产 agent 团队的典型工作流——人工找 trace、下载 JSON、贴给 Claude Code 分析——无法规模化,而最重要的问题恰恰不会抛异常:agent 会安静地重试失败的工具、在无人察觉时悄悄改变行为。文章详述了他们如何设计自动化诊断、尝试让模型批量检查 trace 的几种方案,以及最终把大规模检查下沉为对 trace 数据的普通查询的工程决策。这是与上文 techNmak 推文同源的原始技术复盘。
「编程与Agent」频道最新
- 纽约 Agentic AI 聚会将复盘九月动态并演示 PowerShell 决策工作流 — dfinke · 2026-10-03
- sindresorhus:别让 AI 当 PR 路由,开源该让项目 AI 直接吸收贡献 — vykthur · 2026-10-03
- 从单轮对话到指挥 agent 团队:Every 运营负责人的五个提示词 — danshipper · 2026-10-03
- AI 工程更像立法而非打游戏:规则需随现实不断修正 — danshipper · 2026-10-03
- Claude Code 让人变笨?反驳者:把判断也自动化才是问题 — aakashgupta · 2026-10-03
- Winnipeg 城市 MCP Server 上线,AI 助手可查公交与市政服务 — modelcontextprotocol · 2026-10-03