AI 自动化研究跑通 nanoGPT,击败人类基准

eliebakouch · x · 2026-08-16

Prime Intellect 团队进行了迄今为止最大规模的自主智能体研究实验。他们让 Codex (GPT 5.5) 和 Claude Code (Opus 4.7) 在 nanoGPT 优化赛道上自主迭代约 10,000 次运行,消耗 14,000 H200 小时算力。结果显示,Opus 以 2930 步达到目标验证损失,击败了 2990 步的人类基准。研究发现 Agent 擅长超参数搜索但缺乏新创意,且 Opus 存在拒绝持续工作的问题。所有代码、日志和草稿已开源。

所属事件:最大规模 18 模型 AI 自主研究实测,Fable 5 居首(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →