NanoGPT 优化赛跑评测:18 个前沿模型的 153 次自主运行结果全开源
samsja19 · x · 2026-08-16
PrimeIntellect 发布了 NanoGPT 优化器赛跑的完整评测结果与追踪数据。测试覆盖了 18 个前沿模型(包括 GPT-5.6、Claude、DeepSeek V4、Kimi K3 等)的 153 次自主运行。榜单记录了各模型在 24 小时内实现的最佳验证损失、已闭合的测试用例百分比以及代码执行轨迹,所有工具调用和生成的文件均已公开,便于复现与分析。
所属事件:最大规模 18 模型 AI 自主研究实测,Fable 5 居首(7 条相关)→
「编程与Agent」频道最新
- 定制化开发工具常遇尴尬,传统工具组合仍具优势 — bigblueboo · 2026-08-16
- AI中间产物泛滥,网友提议给智能体加垃圾回收分拣机制 — dht · 2026-08-16
- DeepSeek Harness 48小时破10万星,增速超 OpenClaw — Hesamation · 2026-08-16
- 前端趋势:因 AI 辅助开发,纯 HTML 网站或复兴 — gethackteam · 2026-08-16
- Spawn Games 更新:可联动最喜欢的 Agent 一起玩游戏 — TAbrodi · 2026-08-16
- Agent 选型指南:Opus 擅长 3D,Sol 音频表现出色 — nptacek · 2026-08-16