Sentry CEO zeeg:别 mock LLM 调用,真模型才能真测试
zeeg · x · 2026-10-07
Sentry CEO David Cramer(zeeg)谈 LLM 应用的测试策略:他类比数据库调用——你不会去 mock 每一次数据库调用;同样,与其 mock 期望模型输出的「形状」,不如让真实模型跑起来。因为一旦改模型或行为路径变化,mock 就得不断更新,维护成本高。他强调这与多数人做的定性 eval 不同:evals 本质是用 LLM 判断结果的调用,而如果你在搭测试 harness,就必须真正调用你在用的模型。
所属事件:Sentry CEO 吐槽:agent 测试套件每跑一次花费 10 美元(8 条相关)→
「编程与Agent」频道最新
- OpenAI 弃用旧版用户 API 密钥,10 月 22 日前须迁移否则服务中断 — ThePeterMick · 2026-10-07
- 开源项目 YourHand:一个 AI 对话同时操控多台 Windows 电脑 — arch_ahmedzaki · 2026-10-07
- 一行提示让编码 agent 少添乱:在 AGENTS.md 写「当成疲惫工程师共事」 — cem2ran · 2026-10-07
- mitsuhiko 自嘲:有了 bash 工具,codemode 这个简单概念反而难讲清 — mitsuhiko · 2026-10-07
- Agent 逆向 Minecraft 建筑实证:边测绘边摆方块还能自造资产 — Promptmethus · 2026-10-07
- 开发者让 Codex 3 分钟写出读取太阳能板数据的 macOS 应用 — Dimillian · 2026-10-07