用项目反应理论预测 Agent 在新任务上的表现,COLM 2026 新研究
dan_fried · x · 2026-10-09
在 COLM 2026 的海报报告中,研究者提出用 项目反应理论(Item Response Theory, IRT) 来改进 coding agent 评测:
- 现有 agent 评测 = 基准上的单一准确率数字,掩盖了「基准里哪些任务更难、为什么难」这一关键信息
- 该工作在任务粒度上分析 agent 表现,并用 IRT 预测新 agent 在新任务上的表现,以及未见的 model/harness 组合表现
- 降低了「换个 harness 排名就变」的评测噪声,让基准结果更可迁移
论文将出现在 ICLR 2026 AIWILD workshop。
「编程与Agent」频道最新
- 用 AI 一小时搭出带 Salesforce 链接的定制销售仪表盘 — thisiskp_ · 2026-10-09
- Nvidia 论文:训练与改技能文件交替进行,Agent 提分最显著 — rohanpaul_ai · 2026-10-09
- 开发者称 ultrafast 改变心流:专注单任务即时迭代 — Dimillian · 2026-10-09
- GPT-6.1 Sol ultrafast 实测:比标准模式快 8 倍写 SwiftUI — Dimillian · 2026-10-09
- 开发者自建 Gmail AI 回复助手:靠记忆工具越用越准 — Al_Grigor · 2026-10-09
- 新论文提出 Agent Plasticity:衡量智能体从经验中自我改进的效率 — anirudhg9119 · 2026-10-09