HYBRID 的 AI 教练四分之一对话出错却零告警,Amplitude 推 Agent Analytics 补盲区
aakashgupta · x · 2026-09-15
YC 系公司 HYBRID 的 AI 教练机器人曾有 1/4 的对话出错却零错误日志:一个工具重试 bug 不断误触发,但因为 agent 每次都「产出了回答」,分析系统记为完整会话、可观测性也显示 trace 干净——唯一能发现它的只有早已太迟的转化率下滑。
作者指出这是几乎所有 agent 团队的盲区:analytics 只说明会话发生了,observability 只说明 trace 没断,都不回答「回答好不好、用户信不信、有没有促成转化」。Amplitude 2025 年在自己内部遇到同样问题后自建了 Agent Analytics,现对外开放:
- 每个 trace 自动评分:任务成功与否、失败类型、工具调用错误
- 每个对话变成可度量的转化事件,可按转化率对模型供应商排序、按意图聚类对话
三个客户案例:The Economist 的 Lens 助手任务成功率达 96.9%、周失败数下降 84%;HYBRID 修好 1/4 问题后,使用 AI 教练的运动员留存是不用的 4 倍;Cashbook 发现糟糕的首次 AI 回答悄悄拖累了全应用 15% 的留存。核心结论:回复质量正在成为被刻意追踪的指标,先数起来的团队才能在营收曲线恶化前发现问题。
「编程与Agent」频道最新
- Agent 不该拍板:支持案例归属交人审批,模型只出草稿 — WirelessLife · 2026-09-15
- 开发者用 Devin 与自建 Agent 每日自动筛信息:AI Agent 成新信息入口 — bendee983 · 2026-09-15
- Anthropic:Claude 写了 80% 代码,CI 任务量半年暴涨 25 倍 — addyosmani · 2026-09-15
- 语音 Agent 上线数月复盘:真实通话日志揪出 7 个脚本测试抓不到的行为 bug — authentic_developer · 2026-09-15
- 开发者出售 codebase.md 与 discover.md 两枚 AI 域名 — iannuttall · 2026-09-15
- 「tokenmaxxing」新梗:不自己解题,反正上下文装得下 — tech__unicorn · 2026-09-15