18模型自主编程大比拼:最强闭合人类记录82%
AI寒武纪 · wechat · 2026-08-16
PrimeIntellect 进行了迄今最大规模的自主 AI 研究实验,将 18 个顶尖模型置于隔离沙箱中执行 nanoGPT 优化任务。实验旨在验证模型能否自主完成科学调优。
核心结论:
- 能力分层明显:Fable5 跑出 2726 步,闭合人类记录差距 81.7%;Opus5 与 KimiK3 紧随其后。部分模型如 GPT-5.5 表现接近随机水平。
- 差距源于研究品味:强模型(如 Opus5)懂得处理噪声,会回头重测失败的配方并消融分析,而弱模型易因单次失败放弃有效方向。
- 具备造工具意识:部分模型构建了内部数值实验室或采用多智能体(理论家、审计员)协作模式,在低成本的合成环境中验证假设后再投入昂贵训练。
- 缺乏新颖性:虽然执行力和理解力强,但所有模型未发现本质上的新方法,仅是对已知技术的组合与调优。
所属事件:Prime Intellect 发布最大规模 AI 自主研究实验(9 条相关)→
「编程与Agent」频道最新
- 开源库:用 Python 自动化处理 Topaz Gigapixel AI — tom_doerr · 2026-08-16
- RTX 5090单卡跑Qwen3.8-27B NVFP4:vLLM+256K上下文,147 tok/s — AIFlow_ML · 2026-08-16
- Agent 复现 NanoGPT 优化,与人类差距一年缩半 — MinqiJiang · 2026-08-16
- 批判 Vibe-coding:如何正确指导学生使用 AI 编程 — pbloemesquire · 2026-08-16
- 企业百个 AI Agent 蔓延,云资源式管理危机隐现 — Ok_Intention1336 · 2026-08-16
- 从业者称90%的AI智能体是噱头,分享3个真正赚钱的工作流 — Affectionate-Ask7235 · 2026-08-16