新模型长程编码 FrontierSWE v2 达 55%,远超 Gemini 3.x 的 20%

xennygrimmato_ · x · 2026-10-01

被引用推文称,Argon 在长程编码(long-horizon coding)能力上大幅领先 Gemini 3.x:在 FrontierSWE v2 基准上拿到 55.0%,而 3.7 和 3.8 仅约 20%。发帖人补充称 Gemini 4 在长程编码上「极其出色」,并对 GDM 专注这类能力表示兴奋。(注:模型命名与数据以原帖为准,未见官方证实。)

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →