如何确认 Agent 真做了事
Slightly_F0ol1Sh · reddit · 2026-07-16
作者在生产环境跑 agent 几个月后,最头疼的问题不是模型“会不会说”,而是怎么确认它真的做成了。
核心问题
- agent 会把“我已经保存/找到”说成已完成,但真实副作用并没有发生。
- 这类错误不会立刻暴露,往往会在下游慢慢堆积,最后才被发现。
现有做法
- 不再相信 agent 自己的输出。
- 用一个“笨办法”做外部校验:比如检查数据库里是否真的有新行、文件是否真的落盘。
- 如果没有真实结果,就让步骤直接失败,而不是静默通过。
仍未解决的难题
- 更难的是长期漂移:agent 可能今天还正常,几周后悄悄失效,但系统没有自动告警。
- 作者想听大家是怎么区分“agent 真的做了事”和“只是声称做了事”的。
所属事件:AI Agent 生产可靠性:别信自述要验结果(8 条相关)→
「编程与Agent」频道最新
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11
- 浏览器主线程很贵:动画卡顿的真正成本与前端优化实践 — jh3yy · 2026-09-11
- 开源工具 Claude Unlimited:多账号轮换让 Claude Code 会话不断线 — Similar_Injury_6739 · 2026-09-11
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11