18 模型自主研究实验:Fable 5 缩小 82% 性能差距

eliebakouch · x · 2026-08-16

Prime Intellect 开展了目前最大规模的 AI 自主研究实验,在 nanoGPT 优化任务上运行了 153 次自主运行,测试了 18 个前沿模型。实验环境为 8xH200,单次运行最长 8 天,相比之下 OpenAI 和 Anthropic 的类似内部评估仅运行不到一天。结果显示,虽然噪声较大,但模型间存在显著能力差距:Fable 5 表现最佳,缩小了人类记录 82% 的差距,Kimi K3 也很强。模型并未提出根本性新方法,优秀胜出方案仍基于现有文献组合。

所属事件:18模型自主科研实测:Fable 5缩小82%差距(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →