FrontierSWE v2 惊人细节:顶级 agent 抄现成实现,耗 10 小时硬刚编译
xeophon · x · 2026-09-08
brendanwduke 查看 ProximalHQ 的 FrontierSWE v2 基准时发现一个有趣任务:在 Modular 的 MAX/Mojo 上实现 Wan 2.1。但近期 trace 显示,Kimi K3 与 Fable 5.1 都立刻发现已发布的 MAX 本身就实现了 Wan,于是直接复制现成实现,随后花 10+ 小时与超过 1 小时的图编译时间搏斗。
以 Kimi K3 的 trace 为例:9 小时 26 分、306 步、90.2M 输入 token、花费 $34.42,最终得分 0.9307。这既展示了 agent 长程任务的真实成本结构,也暴露了它们倾向走捷径的解题策略。brendanwduke 同时赞赏这种「比开放权重更进一步」的基准设计——模型+数据+训练+RL 全栈开放对开发者更有用。
「编程与Agent」频道最新
- Candidly 实战复盘:状态感知让 AI 对话解决率从 30% 提到 78% — LangChain · 2026-09-08
- 用户参与度差距62个百分点,一个prompt插入可修复 — LangChain · 2026-09-08
- 无 UI 之作:Opik 团队为 agent 设计终端版 LLM 可观测性 UX — dl_weekly · 2026-09-08
- Cursor、VS Code、Antigravity 同现一键 RCE 漏洞:点链接即丢 API 密钥 — stanislavfort · 2026-09-08
- AI自主发现Cursor与VS Code零日漏洞,点击链接即可接管电脑 — stanislavfort · 2026-09-08
- AISLE AI自主发现Cursor、Antigravity与VS Code零日漏洞 — stanislavfort · 2026-09-08