Prime Intellect 发布 18 个前沿模型的自主 AI 研究能力评估报告
mariofilhoml · x · 2026-08-28
Prime Intellect 发布了关于“测量自主 AI 研究”的实验结果。他们在 18 个前沿模型上运行了 153 次自主运行任务(基于 nanoGPT 优化速度跑),每次运行长达 8 天。结果显示,不同模型在研究能力上存在显著差距,体现在实验选择、执行严谨度及结果解读上。尽管没有运行产生根本性的新方法,但 Claude Fable 5 和 Opus 5 等模型表现远超其他模型。该测试旨在评估 AI 的自主研究能力及递归自我改进潜力。
「模型」频道最新
- GLM-5.2 引入监控机制,有效对抗 RL 奖励黑客攻击 — burny_tech · 2026-08-28
- 实测 Anthropic Luna Max:额度宽松速度极快 — timpera · 2026-08-28
- 用户吐槽 Grokbot 表现糟糕,任务遗漏严重 — krishnan · 2026-08-28
- 模型优化不应只追求思考时的 token 数量 — abacaj · 2026-08-28
- ChatGPT 自动添加神秘代码,用户困惑求原因 — TheMoonMidas · 2026-08-28
- 实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s — mayfer · 2026-08-28