FrontierSWE v2 惊人细节:顶级 agent 抄现成实现,耗 10 小时硬刚编译

xeophon · x · 2026-09-08

brendanwduke 查看 ProximalHQ 的 FrontierSWE v2 基准时发现一个有趣任务:在 Modular 的 MAX/Mojo 上实现 Wan 2.1。但近期 trace 显示,Kimi K3 与 Fable 5.1 都立刻发现已发布的 MAX 本身就实现了 Wan,于是直接复制现成实现,随后花 10+ 小时与超过 1 小时的图编译时间搏斗。

以 Kimi K3 的 trace 为例:9 小时 26 分、306 步、90.2M 输入 token、花费 $34.42,最终得分 0.9307。这既展示了 agent 长程任务的真实成本结构,也暴露了它们倾向走捷径的解题策略。brendanwduke 同时赞赏这种「比开放权重更进一步」的基准设计——模型+数据+训练+RL 全栈开放对开发者更有用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →