18个模型断网自主科研8天,Fable5追回人类82%差距

新智元 · wechat · 2026-08-17

PrimeIntellect 发布迄今规模最大的前沿模型自主科研实验:18 个顶尖大模型在断网沙盒(bwrap+网络命名空间,每场独占 8×H200 节点)中完全自主运行 8 天,挑战 nanoGPT 优化器速通赛道——不改架构、不动数据,用最少训练步数把 GPT 训到验证损失 3.28。人类纪录是几十位工程师数月死磕出的 2600 步,AI 起点为 3290 步;纪录需在 8 个固定种子上复验(蒙对概率仅千分之一),并有独立 LLM 监督员每小时审计,未发现作弊。最终 Fable5 跑到 2726 步、追回 82% 差距,Opus5 追回 54%,垫底的 GPT-5.5 仅 8%;统一预算横比(同等时间/实验数/token)后排序几乎不变,领先靠的不是堆时间。

最反直觉的发现:没有一个模型发明全新方法,胜负全在实验方法论。弱模型的典型毛病是单种子负结果就判整族方法死刑、把自己的代码崩溃当成「想法不行」;强模型则先用 3 个种子试探、值得才上 8 个种子,并在每次合并后回头重测整个技术栈——Opus5 靠重调早被弃用的 β2 参数拿下纪录,Fable5 靠测试「单独更差、组合更优」的改动一次省下 31 步。模型还自发在 CPU 上搭模拟实验室先摸规律再上 GPU;GPT-5.6 Sol 给自己组了三人多 Agent 研究团队,因共享目录互相覆盖而翻车,随后用「只读合约」修复协作。

文章将结果对照 OpenAI 首席科学家 Pachocki 的路线图(今年 9 月自主研究实习生、2028 年全自动多 Agent 研究系统)与 Anthropic 联创 Jack Clark「2028 年底递归自我改进概率超 60%」的预测:那 99% 的汗水,AI 已干掉 82%;但 1% 的灵感——全新算法创新——暂时还是人类的护城河。

所属事件:Prime Intellect 公布最大规模自主研究实验结果(16 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →