Agent 跑错又没有对照样本时,该拿什么当调试基准?

Sensitive-Parsnip-12 · reddit · 2026-09-07

楼主抛出一个 agent 调试的棘手场景:一次 run 结果明显错误,但手头没有“已知正确”的 run 可对照,这时该用什么作参考?

他列了几种候选思路:

作者特别想了解多步 agent/工作流系统的实战经验,并认为可信的“参照物”很大程度取决于系统类型,邀请大家分享自己是在做什么项目时撞上这个问题的。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →