AutoDataBench:Agent 自造训练数据尚可,45 分钟内得分不足 20/100
Haotian Luo · hf · 2026-09-30
AutoDataBench 提出以数据工业的交付标准评测 Agent 自主合成可验证训练任务的能力:给定原基准任务和目标模型作答记录,Agent 需写出符合有效性、新颖性、难度与行为覆盖等验收标准的新任务,无需真正训练即可直接衡量。在三个可执行 Agent 任务基准上,默认 45 分钟预算内没有任何 Agent 得分超过 20/100;给最强 Agent 四倍时间可显著提分,但单个可用任务的成本几乎不变。结论:现有 Agent 能写出合格质量的训练任务,但效率不足。作者认为自动化任务生成是递归自我改进(RSI)的关键一环,能让数据产能随算力而非专家人数扩展。代码与数据已开源。
「研究」频道最新
- 多机构联办研究 Agent 竞赛:无人类监督自主完成后训练 — my_cat_can_code · 2026-09-30
- AI 生成合金微结构:边缘损失+结构相似度损失保住晶界物理意义 — bravo_abad · 2026-09-30
- SOSP26 论文 YoloFS:290 起智能体误删文件报告催生 Agent 原生文件系统 — tianyin_xu · 2026-09-30
- 新论文:Claude Code、Codex 等 Agent 可随意篡改自身执行日志 — maksym_andr · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- AnyStep-WAM:按任务难度自适应分配去噪步数,平均省 60% 步数不掉成功率 — Rui Wang · 2026-09-30