最大规模 18 模型 AI 自主研究实测,Fable 5 居首
Prime Intellect 于 8 月 16 日发布博客《Measuring Autonomous AI Research》及配套自主研究排行榜,公布迄今最大规模的 AI 自主研究实验:在 nanoGPT 优化任务上以 8xH200 沙箱完成 153 次自主运行、覆盖 18 个前沿模型,单次运行最长 8 天,完整结果与追踪数据全部开源。Fable 5 以 2,726 步位列第一,缩小 81.7% 的人类性能差距。该实验为衡量前沿模型的自主科研能力提供了可复现的公开基准。
已确认
- 实验设置:nanoGPT 优化任务,8xH200 沙箱环境,单次运行最长 8 天,共 153 次自主运行、测试 18 个前沿模型。
- 参测模型:@samsja19 转述的名单包括 GPT-5.6、Claude、DeepSeek V4、Kimi K3 等。
- 排行榜结果:@eliebakouch 称 Fable 5 以 2,726 步的成绩位列第一,缩小 81.7% 的性能差距,Opus 5 与 Kimi K3 紧随其后;他在多条帖子中另将差距概括为约 82%。
- 数据开源:@samsja19 确认完整评测结果与各模型运行追踪数据已全部开源。
- 人类基准:最佳运行缩小的是由数十名人类设定的基准(相关帖子在人类耗时处截断,具体数字缺失)。
- 规模对比:@eliebakouch 提及与 OpenAI、Anthropic 等此前同类实验的规模对比,称本次规模更大(帖子截断,细节缺失)。
尚未确认
- 同日另一帖(m6)口径明显不同:@eliebakouch 称让 Codex (GPT 5.5) 与 Claude Code (Opus 4.7) 在 nanoGPT 优化赛道自主迭代约 10,000 次运行并击败了人类基准,与主帖 153 次运行、18 模型、缩小 81.7% 差距(未完全超越)的说法不一致;其模型版本号(GPT 5.5、Opus 4.7)也与 m3/m4 所列的 GPT-5.6、Opus 5 存在出入。因帖子被截断,这属于累计口径、笔误还是另一次实验,材料中无法确认。
为什么重要
- 这是目前规模最大的开放自主科研评测之一,完整数据开源使其成为可复现的公开基准,可对 18 个前沿模型的自主研究能力做横向比较。
- 最佳运行已缩小逾八成与人类基准的差距,直接检验了 Agent 在真实算力沙箱中长周期自主迭代的能力。
2026-08-16 ~ 2026-08-16 · 6 条相关
一手来源
- 博客:测量自主 AI 研究,153 次运行实测前沿模型 — eliebakouch ·
- 自主研究排行榜:Fable 5 第一,Kimi K3 紧随其后 — eliebakouch ·
- NanoGPT 优化赛跑评测:18 个前沿模型的 153 次自主运行结果全开源 — samsja19 ·
- 18 模型自主研究实验:Fable 5 缩小 82% 性能差距 — eliebakouch · 2026-08-16
- 【源头】博客:测量自主 AI 研究,153 次运行实测前沿模型 — eliebakouch · 2026-08-16
- 【源头】自主研究排行榜:Fable 5 第一,Kimi K3 紧随其后 — eliebakouch · 2026-08-16
- 前沿模型AI研究实验:最佳运行结果闭合82%人类差距 — eliebakouch · 2026-08-16
- AI 自动化研究跑通 nanoGPT,击败人类基准 — eliebakouch · 2026-08-16
- 【源头】NanoGPT 优化赛跑评测:18 个前沿模型的 153 次自主运行结果全开源 — samsja19 · 2026-08-16