为什么评测全过的 AI agent 到了生产还会漂移
Diligent_Response_30 · reddit · 2026-07-29
为什么通过所有 eval 的 agent,到了生产环境还是会漂移
作者表示自己平时就在做 AI agent 的生产评测,常见现象是:一个 agent 在 staging 里把所有评测都跑通了,但真实流量一进来,几周后行为就开始悄悄漂移。
帖子指出,问题出在一次性的静态评测覆盖不了真实生产流量。常见原因包括:
- eval 数据和真实用户输入分布不同,没测到的情况在生产里变多了;
- 上游 prompt 或模型版本变化,导致行为被悄悄改写;
- 工具和 API 返回结构变化,agent 不会明显报错,而是默默适配;
- 缺少全链路可观测性,最先发现问题的往往是下游用户投诉。
作者给出的思路是把评测变成持续过程:对每次运行做 tracing,实时打分 drift 和风险,并提供 human-in-the-loop 的拦截机制,而不是只在事后看日志。
帖中也披露,他们正在做这类工具,而且已经上线 Product Hunt。
「编程与Agent」频道最新
- TopoGR 用 Hamming 几何保住生成式推荐的语义 ID 拓扑 — _reachsumit · 2026-07-29
- Grevo 把语义 ID 分配改造成可进化变量 — _reachsumit · 2026-07-29
- 一图看懂 10 种 AI Agent 架构与组合方式 — Obijuan_cube · 2026-07-29
- 现代AI智能体技术栈:从规划到人机协同的完整分层 — goyalshaliniuk · 2026-07-29
- Agentic RAG 把检索生成变成规划验证闭环 — goyalshaliniuk · 2026-07-29
- 生产级 AI 系统往往是规划、记忆、工具的混合体 — goyalshaliniuk · 2026-07-29