AutoDataBench:Agent 自造训练数据尚可,45 分钟内得分不足 20/100

Haotian Luo · hf · 2026-09-30

AutoDataBench 提出以数据工业的交付标准评测 Agent 自主合成可验证训练任务的能力:给定原基准任务和目标模型作答记录,Agent 需写出符合有效性、新颖性、难度与行为覆盖等验收标准的新任务,无需真正训练即可直接衡量。在三个可执行 Agent 任务基准上,默认 45 分钟预算内没有任何 Agent 得分超过 20/100;给最强 Agent 四倍时间可显著提分,但单个可用任务的成本几乎不变。结论:现有 Agent 能写出合格质量的训练任务,但效率不足。作者认为自动化任务生成是递归自我改进(RSI)的关键一环,能让数据产能随算力而非专家人数扩展。代码与数据已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →