新工具用轨迹差分抓住模型切换后的 Agent 回归
Impossible-Alarm-738 · reddit · 2026-07-22
- 作者是在一次模型切换静默破坏了 agent 行为之后做出这个工具的:表面上回复都正常、现有 eval 也都通过,但 cancelsubscription 工具调用其实已经不再发生,导致用户被告知“已取消”而实际没有取消。
- whatbroke 的思路不是看文本 diff,而是对比两次运行的 JSONL 轨迹:调用了哪些工具、参数是什么、顺序如何、耗时和成本多少、最终输出是什么,从而抓住真实行为变化。
- 它还提供代理模式 whatbroke record,可以不改代码地抓取任意语言的 trace;并考虑到 agent 非确定性,支持同一场景多次记录,用 flap rate 区分“本来就不稳定”的行为和真正的回归。
- 工具是离线、确定性的,MIT 许可,且可以在 CI 里通过退出码 1 直接拦住破坏性变更。
所属事件:开发者推新工具检测模型切换引发的Agent回归(2 条相关)→
「编程与Agent」频道最新
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11