Sentry CEO zeeg:别 mock LLM 调用,真模型才能真测试

zeeg · x · 2026-10-07

Sentry CEO David Cramer(zeeg)谈 LLM 应用的测试策略:他类比数据库调用——你不会去 mock 每一次数据库调用;同样,与其 mock 期望模型输出的「形状」,不如让真实模型跑起来。因为一旦改模型或行为路径变化,mock 就得不断更新,维护成本高。他强调这与多数人做的定性 eval 不同:evals 本质是用 LLM 判断结果的调用,而如果你在搭测试 harness,就必须真正调用你在用的模型。

所属事件:Sentry CEO 吐槽:agent 测试套件每跑一次花费 10 美元(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →