18 模型自主研究实验:Fable 5 缩小 82% 性能差距
eliebakouch · x · 2026-08-16
Prime Intellect 开展了目前最大规模的 AI 自主研究实验,在 nanoGPT 优化任务上运行了 153 次自主运行,测试了 18 个前沿模型。实验环境为 8xH200,单次运行最长 8 天,相比之下 OpenAI 和 Anthropic 的类似内部评估仅运行不到一天。结果显示,虽然噪声较大,但模型间存在显著能力差距:Fable 5 表现最佳,缩小了人类记录 82% 的差距,Kimi K3 也很强。模型并未提出根本性新方法,优秀胜出方案仍基于现有文献组合。
所属事件:18模型自主科研实测:Fable 5缩小82%差距(5 条相关)→
「编程与Agent」频道最新
- Grok IDE 中继服务开源,设计假设服务器为敌对环境 — PawelHuryn · 2026-08-16
- 开源数据集查看器:AI Agent构建,秒开100GB+文件 — tom_doerr · 2026-08-16
- langctl:一键脚手架部署 LangChain 生产级 Agent — hwchase17 · 2026-08-16
- 用 AI 写游戏请分离配置文件,优化参数调试体验 — zack_overflow · 2026-08-16
- 程序员感慨:让 nac 自动改引擎太反直觉 — sloppenheimer · 2026-08-16
- Claude Fable一次生成可运行NES模拟器,单HTML文件流畅玩马里奥 — MAGA_R_TRAITORS · 2026-08-16