NanoGPT 优化赛跑评测:18 个前沿模型的 153 次自主运行结果全开源

samsja19 · x · 2026-08-16

PrimeIntellect 发布了 NanoGPT 优化器赛跑的完整评测结果与追踪数据。测试覆盖了 18 个前沿模型(包括 GPT-5.6、Claude、DeepSeek V4、Kimi K3 等)的 153 次自主运行。榜单记录了各模型在 24 小时内实现的最佳验证损失、已闭合的测试用例百分比以及代码执行轨迹,所有工具调用和生成的文件均已公开,便于复现与分析。

所属事件:最大规模 18 模型 AI 自主研究实测,Fable 5 居首(7 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →