Prime Intellect 发布 18 个前沿模型的自主 AI 研究能力评估报告

mariofilhoml · x · 2026-08-28

Prime Intellect 发布了关于“测量自主 AI 研究”的实验结果。他们在 18 个前沿模型上运行了 153 次自主运行任务(基于 nanoGPT 优化速度跑),每次运行长达 8 天。结果显示,不同模型在研究能力上存在显著差距,体现在实验选择、执行严谨度及结果解读上。尽管没有运行产生根本性的新方法,但 Claude Fable 5 和 Opus 5 等模型表现远超其他模型。该测试旨在评估 AI 的自主研究能力及递归自我改进潜力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →