多步Agent不能只看答案
Future_AGI · reddit · 2026-07-15
作者指出,多步 agent 常见的问题是:最终答案对了,但中间路径是错的,比如调用了错误工具、重复重试、走了很多无效步骤。只看最终输出,会把这类“隐性失败”漏掉。
他们的做法是把调试和评估拆到更细的粒度:
- 不是只看 prompt/completion,而是把整次运行表示成 span graph,记录每个检索、工具调用和模型步骤的延迟与 token 成本
- 给每个 span 单独打分,而不只给最终结果打分,这样“答案对但工具用错”的情况也会暴露
- 在模拟环境里跑大量多轮对话,加入真实 persona、对抗输入和边界案例,尽量在上线前发现死循环和错误路径
他们还表示这套 tracing、逐 span eval 和仿真能力集成在一个开源、Apache-2.0、自托管的平台里,仓库链接在评论中。
所属事件:AI Agent 生产可靠性:别信自述要验结果(8 条相关)→
「编程与Agent」频道最新
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 开源工具 Claude Unlimited:多账号轮换让 Claude Code 会话不断线 — Similar_Injury_6739 · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11