Adobe 论文:用可执行代码替代固定答案,agent 评测准确率提升 29%
rohanpaul_ai · x · 2026-10-01
Adobe 研究团队针对实时数据科学任务的 agent 评测提出新方法:传统 agent 测试假设标准答案不变,但在活跃数据上正确答案会随时间变化,导致评分失真。
其做法是把"正确答案"写成一段代码,每次评测运行时实时拉取最新结果,再由 AI 评分器据此判定 agent 回答的对错。
在 53 个测试用例上,AI 评分器以代码为参照相比使用文字描述的答案,与人类专家的判断一致性提高 29%,token 消耗反而减少 16%;而完全没有参照答案时,AI 评分器的表现甚至不如随机。
论文:《Skill-based Agentic Evaluation for Real-time Data Science Tasks》(arXiv:2609.16487)。
「研究」频道最新
- 公开数据集为何值得警惕:好数据没人愿意白送 — yenkel · 2026-10-01
- Boston Dynamics 为 Atlas 装上 13 自由度灵巧手,为 sim-to-real 强化学习而生 — chris_j_paxton · 2026-10-01
- Karl Friston 播客:超越自由能原理,被好奇心驱动的一生 — burny_tech · 2026-10-01
- LSD 在线蒸馏法消解 RL 后训练的「长度税」,减少近 23 个百分点 — Xu Wan · 2026-10-01
- Salesforce Research 4 篇论文入选 COLM 2026,10 月旧金山亮相 — TuhinChakr · 2026-10-01
- AI Atlas:用数据覆盖思路应对世界模型幻觉问题 — rudina11 · 2026-10-01