Adobe 把评测参考答案写成 Python 函数,LLM 评委一致性 MCC 从 0.331 升至 0.427
dair_ai · x · 2026-09-17
Adobe 研究团队提出一种新的 agent 评测思路:传统做法为每个评测用例存一份固定参考答案,但当底层数据每天变化时,存储的答案会迅速过时。
他们的做法:
- 把每个参考答案写成 Python 函数,评测时直接对活系统运行,期望答案随数据实时更新;上游 API 变更会让测试显式失败
- 再用一个 LLM 评委把 agent 回复与函数计算结果拆成原子事实,按 precision/recall 打分,不受输出格式影响
效果:对比专家标注,评委一致性 MCC 从 0.331 提升到 0.427,每用例 token 成本下降 16%。没有 ground truth 的评委 MCC 仅 -0.379,比随机还差。整个流水线以 harness skill 形式运行;作者列出的局限之一是评委和被评对象都用了同一个模型 Claude Sonnet 4.6。
「编程与Agent」频道最新
- 开发者提议 Claude Code 应做预测性动态上下文缓存 — Sauers_ · 2026-09-17
- 实测者称 Devin Fusion 是当前智能成本比最优的编程 agent — brandon_galang · 2026-09-17
- 网友为《战神》搭了个 RL 环境,让智能体玩出整段游戏 — silver__tsuki · 2026-09-17
- 用知识图谱替代纯向量检索,让 RAG 答案可审计可溯源 — camerongreen95 · 2026-09-17
- 用 AI 复刻 386 时代的童年游戏,Completer 完成老游戏移植 — banteg · 2026-09-17
- Copilot 模式有隐性瓶颈:人类审阅速度成规模化天花板 — Informal-Dust4499 · 2026-09-17