博客:测量自主 AI 研究,153 次运行实测前沿模型

eliebakouch · x · 2026-08-16

Prime Intellect 发布博客《Measuring Autonomous AI Research》,旨在评估前沿模型进行科研的能力。他们在 nanoGPT 优化任务上进行了 153 次自主运行,涵盖 18 个模型,单次运行长达 8 天。文章指出,尽管此类“速通”任务的方法未必能直接扩展到真实模型训练,但其快速反馈循环非常适合评估 AI 的科研潜力。实验揭示了模型间的巨大能力差异,这种差异体现在实验选择、执行严谨度及结果解读的各个阶段。虽然所有运行都未提出根本性新方法,但 Fable 5 和 Opus 5 表现远超其他模型。

所属事件:最大规模自主AI研究实验发布(7 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →