Sentry CEO 谈 agent harness 测试:eval 不等于真实模型调用

zeeg · x · 2026-10-07

Sentry CEO David Cramer(zeeg)在回复中区分两类验证:evals 本质是用 LLM 判断结果的调用,而测试 agent harness 时需要真正驱动所用模型、跑真实推理,两者不是一回事。对方建议用 mock 的 LLM 响应做确定性测试,他后续回应认为很多改动必须针对真实模型验证行为。

所属事件:Sentry CEO 吐槽:agent 测试套件每跑一次花费 10 美元(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →