Sentry CEO 吐槽:agent 测试套件每跑一次花费 10 美元
Sentry CEO David Cramer(网名 zeeg)10 月 7 日发推吐槽:当 agent 的测试套件每跑一次就要花 10 美元的真实 LLM 推理费用时,「PR 最大化」(依赖 AI 代理高频提 PR)式开发该怎么办。这一吐槽折射出 AI 编码代理普及后,代理高频调用 CI/测试导致推理成本急剧放大的新问题,随即引发关于 LLM 应用测试策略的争论。
已确认
- zeeg 明确表示账单大头来自真实推理费用,测试套件单次成本约 10 美元。
- 在测试方法上,zeeg 区分了两类验证:evals 本质是用 LLM 判断结果的调用,而测试 agent harness 时需要真正驱动所用模型跑真实推理,两者不是一回事。
- 他坚持不应 mock LLM 调用,类比数据库调用——开发者不会 mock 每一次数据库调用;与其 mock 模型输出的「形状」,不如让真实模型跑起来,否则一旦更换模型或行为路径变化,mock 就会失效。
- 面对成本压力,zeeg 表示准备先尝试缓存推理响应的折中方案:测试通过后缓存模型响应,后续复用,而非每次发起真实付费推理。
尚未确认
- 缓存方案能否在保持测试有效性的同时显著降低成本,zeeg 仅表示「准备先试」,尚无结果。
为什么重要
- 讨论方 QuavoBot 建议在测试套件通过一次后缓存模型响应、后续直接回放,哪怕只缓存一天也能省下大量成本;另有开发者质疑在 harness 测试中跑真实推理会给本可确定性的测试引入不确定性,主张用 mock 覆盖边界情况。zeeg 则回应称很多改动需要观察对真实模型行为的影响,强行分离会带来大量复杂度。
- 这场争论指向 AI agent 开发的一个普遍痛点:测试保真度与推理成本之间的权衡尚无行业共识,zeeg 的缓存折中方案是当前较受关注的实践方向。
2026-10-07 ~ 2026-10-07 · 8 条相关
一手来源
- 测试套件跑一次要 10 美元,开发者自嘲 PR Maxing 时代账单 — zeeg ·
- Sentry CEO 谈 agent harness 测试:eval 不等于真实模型调用 — zeeg ·
- harness 测试要不要上真模型?zeeg:准备先试缓存方案 — zwerp ·
- 【源头】测试套件跑一次要 10 美元,开发者自嘲 PR Maxing 时代账单 — zeeg · 2026-10-07
- 别为跑测试付真推理费:套件通过后应缓存响应复用 — QuavoBot · 2026-10-07
- 测试套件一次跑 10 美元?缓存 LLM 响应替掉真实推理 — QuavoBot · 2026-10-07
- 测试 agent 别跑真推理:用 mock 模拟 LLM 响应更省钱 — zwerp · 2026-10-07
- 测试套件跑一次 10 美元,agent 开发者如何应对? — zeeg · 2026-10-07
- 【源头】harness 测试要不要上真模型?zeeg:准备先试缓存方案 — zwerp · 2026-10-07
- 【源头】Sentry CEO 谈 agent harness 测试:eval 不等于真实模型调用 — zeeg · 2026-10-07
- Sentry CEO zeeg:别 mock LLM 调用,真模型才能真测试 — zeeg · 2026-10-07