论文:用 38.5% 题目复现生产级 Agent 评测,误差仅 1 分
omarsar0 · x · 2026-09-24
一篇新论文展示如何以极低成本重新评估生产环境中的 AI agent:仅用 200 道题(完整基准的 38.5%)就能将完整分数复现到 1.03 分以内。
研究方法:
- 对象是一个每月服务数万用户的数据分析 agent,基于 574 次历史基准运行,按日期切分为校准期与留出期
- 对比了随机抽样、缓存结果、固定代表性子集、基于项目反应理论(IRT)的自适应测试
- 多维 2PL 自适应测试保真度最高,但团队最终部署了按难度分层的固定子集——更简单易跑
- 这些子集无需重新校准即可迁移到另外 5 个 agent 家族,且校准窗口短至一天仍保持稳定
对需要频繁跑 agent eval 的团队,这是显著降低评测成本的实用路径。
「编程与Agent」频道最新
- Resend 接入 Stripe Projects,一条命令为 AI Agent 配好邮件服务 — jeff_weinstein · 2026-09-24
- 实测 MiniMax Code 一键建站:自然语言到上线的完整流程 — nikola_mr64990 · 2026-09-24
- AI Agent 测试或成下一个大赛道:自主 QA 层押注可靠性 — DevWithTea123 · 2026-09-24
- 本地脱敏中间件构想:敏感数据不出门也能用外部 LLM — Ai_MOON_SHOT · 2026-09-24
- Harness Engineering 实战指南:让编码 agent 可靠的不止是写代码 — Pavan_Belagatti · 2026-09-24
- Claude Code Projects 支持本地设备,线程可直接跑在自己机器上 — bcherny · 2026-09-24