Adobe 把评测参考答案写成 Python 函数,LLM 评委一致性 MCC 从 0.331 升至 0.427

dair_ai · x · 2026-09-17

Adobe 研究团队提出一种新的 agent 评测思路:传统做法为每个评测用例存一份固定参考答案,但当底层数据每天变化时,存储的答案会迅速过时。

他们的做法:

效果:对比专家标注,评委一致性 MCC 从 0.331 提升到 0.427,每用例 token 成本下降 16%。没有 ground truth 的评委 MCC 仅 -0.379,比随机还差。整个流水线以 harness skill 形式运行;作者列出的局限之一是评委和被评对象都用了同一个模型 Claude Sonnet 4.6。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →