AI4AI-Bench 登场:测试 Agent 能否设计更好的 AI 算法
机器之心 · wechat · 2026-08-22
- AI4AI-Bench 由 EinsiaAI 旗下 NaversLab 发布,测试 LLM Agent 能否真正进入算法设计层(而非只调参),在 X 发布 7 小时获 110 万浏览。
- 选取 10 个真实 AI 研究仓库(8 个训练类,2 个为权重平均与 One-shot 剪枝),流程分两阶段:4 小时自由探索(仅留源码)+ 最长 12 小时独立重跑,用冻结 evaluator 打分,baseline 即原仓库代码。
- 共测 29 个「模型+框架+reasoning effort」配置、290 组实验。Claude Opus 5 整体最强;263 份有效提交中仅 122 份真正触及「模型怎么学」(改 loss、监督信号、update rule 等),这类提交平均分 0.226,远高于只改训练运行的 0.126。
- 提高 reasoning effort 是关键变量:触及算法层的提交比例从 8% 升至 64%,中位实验次数从 4 次增到 16 次,平均分从 0.094 升至 0.196——但仍仅走完 baseline 到理论最优约十分之一的路。
- 三个亮眼案例:把剪枝改造成三阶段蒸馏训练(perplexity 53.4→13 出头)、给权重平均自造 500 倍加速实验工具再学习混合系数、Agentic RL 先用求解器做 imitation learning。共同点是先造验证判断的工具,再改算法。
所属事件:AI4AI-Bench基准测试:AI自我改进能力仍薄弱(3 条相关)→
「编程与Agent」频道最新
- OpenAI 展示用语音在 Codex 实现免手写代码 — OpenAIDevs · 2026-08-24
- Swarms:企业级多智能体编排框架开源 — KyeGomezB · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- Compound Engineering 插件重写:上下文体积缩减 70% — iamrobotbear · 2026-08-24
- Lighter 证明器挑战突破 10 万 TPS,两周提升超十倍 — econoar · 2026-08-24