zeeg 谈评测分野:混合测试 vs 隔离式 prompt 评测
zeeg · x · 2026-09-12
zeeg 继续与 LukeParker 讨论 agent 评测思路,指出 OpenEval 像是一种更受限的评测变体——隔离的"测这个 prompt"模式;而他自己的 vitest-evals 走的是混合测试路线,把评测混在真实测试里。
两人代表了 agent eval 的两种设计取向:隔离环境+独立评委打分,vs 融入现有测试工作流的混合评测。
所属事件:开发者激辩 agent 评测思路:看 trace 而非 UI(2 条相关)→
「编程与Agent」频道最新
- Minecraft 生存 bot 已能正常行走,夜间遭流浪者围杀成新难题 — zeeg · 2026-09-12
- OpenAI 联办全球 50 城同日 Agent 黑客松,9 月 12 日开赛 — seanmcdonaldxyz · 2026-09-12
- 开发者自曝日均烧 2500 美元 token,换来的仍是烂代码 — zeeg · 2026-09-12
- 反驳:agent 任务变慢是因为代码烂,加 token 也救不回 — zeeg · 2026-09-12
- 反驳 agent 变慢论:软件太复杂,agent 还造不了 agent — theo · 2026-09-12
- 开发者力推 Agent Client Protocol:夺回被平台拿走的个人数据主权 — RileyRalmuto · 2026-09-12