Adobe 论文:用可执行代码替代固定答案,agent 评测准确率提升 29%

rohanpaul_ai · x · 2026-10-01

Adobe 研究团队针对实时数据科学任务的 agent 评测提出新方法:传统 agent 测试假设标准答案不变,但在活跃数据上正确答案会随时间变化,导致评分失真。

其做法是把"正确答案"写成一段代码,每次评测运行时实时拉取最新结果,再由 AI 评分器据此判定 agent 回答的对错。

在 53 个测试用例上,AI 评分器以代码为参照相比使用文字描述的答案,与人类专家的判断一致性提高 29%,token 消耗反而减少 16%;而完全没有参照答案时,AI 评分器的表现甚至不如随机。

论文:《Skill-based Agentic Evaluation for Real-time Data Science Tasks》(arXiv:2609.16487)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →