RExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估
najoungkim · x · 2026-10-02
Najoung Kim 团队在 COLM 2026 期间推进两个方向:
- RExBench(ACL 2026):评估 LLM agent 能否自主实现 AI 研究论文的扩展,含 12 篇真实论文的任务、专家撰写的指令与自动执行评测。结果:12 个 agent(aider、OpenHands 框架)无一能自主完成多数扩展,最佳成功率约 33%;加入人类提示后也不到 44%。
- 后续项目:由 Audrey 主导的人类在环研究 agent 评估,聚焦 ideation 能力,正在招募参与者并征集对评估设计的意见。
「编程与Agent」频道最新
- 资深开发者:AI 擅长写代码造资产,却做不好游戏手感设计 — rms80 · 2026-10-03
- 免费 AI Agent 学习路线:一天四级从入门到 MCP 与安全 — ifioknkem · 2026-10-03
- 用 Swift 调用 System One 模型:毫秒级确定性决策,成本远低于 LLM — rxwei · 2026-10-03
- 一条全局规则并行跑 50 个 AI agent:后台任务流工作流分享 — Daniel_Farinax · 2026-10-03
- 为何 Linear Agent Session 比 Slack 更适合智能体协作 — jeff_weinstein · 2026-10-03
- SWE-chat 数据集发布 V2:规模扩大 3.5 倍并加入子智能体轨迹 — Diyi_Yang · 2026-10-03