AI 自动化研究跑通 nanoGPT,击败人类基准
eliebakouch · x · 2026-08-16
Prime Intellect 团队进行了迄今为止最大规模的自主智能体研究实验。他们让 Codex (GPT 5.5) 和 Claude Code (Opus 4.7) 在 nanoGPT 优化赛道上自主迭代约 10,000 次运行,消耗 14,000 H200 小时算力。结果显示,Opus 以 2930 步达到目标验证损失,击败了 2990 步的人类基准。研究发现 Agent 擅长超参数搜索但缺乏新创意,且 Opus 存在拒绝持续工作的问题。所有代码、日志和草稿已开源。
所属事件:最大规模 18 模型 AI 自主研究实测,Fable 5 居首(6 条相关)→
「编程与Agent」频道最新
- llama.cpp Windows Manager:可视化多模型管理工具开源发布 — wgaca2 · 2026-08-16
- 交互用快模型,后台用慢模型:Grok 4.6 的场景定位 — vikvang1 · 2026-08-16
- Grok IDE 中继服务开源,设计假设服务器为敌对环境 — PawelHuryn · 2026-08-16
- 开源数据集查看器:AI Agent构建,秒开100GB+文件 — tom_doerr · 2026-08-16
- 用户抱怨 ComfyUI 缺乏集成 Minimax 的端到端节点 — haremlifegame · 2026-08-16
- langctl:一键脚手架部署 LangChain 生产级 Agent — hwchase17 · 2026-08-16