评测工程把人工打分降到 77.81 美元,但 judge 仍自相矛盾 13.6%
BLUECOW009 · x · 2026-07-29
这条转述了一篇关于 Agent 评测工程(eval engineering) 的文章:两位研究者用 $77.81 的模型调用替代了 $7,500 的人工打分,但也暴露出生产级 judge 依然很不可靠。
要点包括:
- 同一个 judge 自相矛盾的比例达到 13.6%;
- 它有 72% 的概率偏向先展示的答案;
- 不同 judge 之间的一致性只有 κ = 0.51,统计意义上接近“猜”。
文章主张把评测当成 Agent 系统的一层工程能力,而不是临时脚本:
- 比较时正反顺序都跑一遍再取平均;
- 不要只靠一次判定就上线;
- 重要样本要多次重复试验,用多数票恢复答案;
- 报告应优先看机会校正后的一致性指标,而不是表面命中率。
核心意思很明确:评测本身就是 Agent 产品的一部分。
「编程与Agent」频道最新
- Agent 编程普及将重塑公众对软件开发的认知 — pixlpa · 2026-08-24
- Devin 突破 Slack 阻塞,自主发邮件求反馈 — sandylikesfrogs · 2026-08-24
- 从发号施令到协作,开发者使用Agent习惯转变 — latticecut · 2026-08-24
- 开发者不再写代码:瓶颈已从写代码转为读代码 — thursdai_pod · 2026-08-24
- 普通人用 AI 最大的错:总想造轮子而非用好工具 — Tired40s · 2026-08-24
- DeepPaperNote:将单篇论文转为 Obsidian 研究笔记 — tom_doerr · 2026-08-24