用缓存工具输出重放 agent 会话,无副作用复现 bug 与换模测试
pauliusztin · reddit · 2026-10-03
作者解决 agent 回归测试最难的一环——复现失败时的精确环境:记录每次工具调用,然后重放会话。
- 重放 ≠ 回放:agent 用新代码/prompt/模型从头运行,决策反映改动;但工具调用参数与录制相同时直接返回缓存输出,新参数或改动过的工具则真实执行。
- 四种工具重放策略:history(读缓存)、static(mock)、passthrough(真实执行)、llm(让模型编造结果);未缓存的工具只能在 passthrough 或失败间选择。零工具调用的崩溃运行必须 passthrough,且只在容器内安全。
- 用法:先零改动重放证明录制能复现 bug,修复后再重放并 diff 两次结果。换模型同理——作者把 Sonnet 全部调用换成 gemini-3.8-flash 重放 4 个失败会话组,全部通过。
- 注意:重放消耗真实 token,失败组要小;几个月没再失败的组直接删。作者用 Kitaru 做记录/重放层,跑在 Pydantic AI agent 上,主要用其工具策略与重放 diff。
「编程与Agent」频道最新
- Qdrant 案例检索 280 万份 SEC 文件,FinanceBench 召回达 94.7% — qdrant_engine · 2026-10-03
- AI 圈 slop 循环:Agent 互读垃圾内容,根因是给的上下文太少 — IgorCarron · 2026-10-03
- 开发者必懂的 8 个核心网络概念:从 DNS 到 WebSocket — goyalshaliniuk · 2026-10-03
- 同题对决:Codex 与 Claude 移植红白机游戏,CPU 渲染改 GPU 谁更强 — ssh4net · 2026-10-03
- 开源工具 iFixAi 用 60 项检查给 AI Agent 打出 A 到 F 业务审计分 — thisdudelikesAI · 2026-10-03
- 并行 Agent 撑爆 worktree 空间,作者让 agents 主导研究 Git 替代方案 — Al_Grigor · 2026-10-03