Meta AI 推出 AutoBenchmark:自动造基准,发现人类介入收益巨大
jaseweston · x · 2026-09-30
Meta AI 研究员 Jason Weston 发布 AutoBenchmark 项目:让 autoresearch 智能体自动创建基准,再用这些基准反过来评测 autoresearch 智能体本身,形成完整的递归改进闭环,并系统研究「人类在环」的作用。
关键发现:
- 人类-智能体协作显著优于纯智能体:构思阶段的细粒度人类反馈至关重要,未来可用 AutoBenchmark 在更强智能体上量化这一点;
- 用该配方可以造出「autoresearch 基准」,实现递归自我改进;
- 基准创建最有效的两个反馈来源:基准解题者 + 外部验证者(人类+AI)。
「研究」频道最新
- Cohere Labs 举办 IOL-AI 2026 总结会,复盘语言学推理基准为何仍难倒模型 — Cohere_Labs · 2026-09-30
- MIT 新 AI 击败顶级 Stratego 选手,自博弈+决策时规划更省资源 — nordicinst · 2026-09-30
- 新研究:AI 当「导师」比当「替身」更聪明,用户表现反超 — CackleRooster · 2026-09-30
- 麦肯锡研究:AI 参与的候选药物将发现周期缩短约 15-80% — HealthcareAIGuy · 2026-09-30
- 五个实验名额如何验证 AI 模型?五槽位测试法给出答案 — bravo_abad · 2026-09-30
- AI 模型独立得出 Odlyzko-Poonen 猜想新证明,已用 Lean 完全形式化 — fedzbar · 2026-09-30