Sentry CEO 谈 agent harness 测试:eval 不等于真实模型调用
zeeg · x · 2026-10-07
Sentry CEO David Cramer(zeeg)在回复中区分两类验证:evals 本质是用 LLM 判断结果的调用,而测试 agent harness 时需要真正驱动所用模型、跑真实推理,两者不是一回事。对方建议用 mock 的 LLM 响应做确定性测试,他后续回应认为很多改动必须针对真实模型验证行为。
所属事件:Sentry CEO 吐槽:agent 测试套件每跑一次花费 10 美元(8 条相关)→
「编程与Agent」频道最新
- OpenAI 弃用旧版用户 API 密钥,10 月 22 日前须迁移否则服务中断 — ThePeterMick · 2026-10-07
- 开源项目 YourHand:一个 AI 对话同时操控多台 Windows 电脑 — arch_ahmedzaki · 2026-10-07
- 一行提示让编码 agent 少添乱:在 AGENTS.md 写「当成疲惫工程师共事」 — cem2ran · 2026-10-07
- mitsuhiko 自嘲:有了 bash 工具,codemode 这个简单概念反而难讲清 — mitsuhiko · 2026-10-07
- Agent 逆向 Minecraft 建筑实证:边测绘边摆方块还能自造资产 — Promptmethus · 2026-10-07
- 开发者让 Codex 3 分钟写出读取太阳能板数据的 macOS 应用 — Dimillian · 2026-10-07