新模型长程编码 FrontierSWE v2 达 55%,远超 Gemini 3.x 的 20%
xennygrimmato_ · x · 2026-10-01
被引用推文称,Argon 在长程编码(long-horizon coding)能力上大幅领先 Gemini 3.x:在 FrontierSWE v2 基准上拿到 55.0%,而 3.7 和 3.8 仅约 20%。发帖人补充称 Gemini 4 在长程编码上「极其出色」,并对 GDM 专注这类能力表示兴奋。(注:模型命名与数据以原帖为准,未见官方证实。)
「模型」频道最新
- Gemini 4 Argon (High) 登顶 Text Arena:1525 分重塑性价比前沿 — holynski_ · 2026-10-01
- 业内期待 Google 借 Gemini 4 Argon 翻盘,抱怨发布日未全面开放 — prateeky2806 · 2026-10-01
- Gemini 4 Argon 省_token 13%,成本效率对标 GPT-6.1 Sol — haider1 · 2026-10-01
- Google 工程师盛赞 Gemini 4:复杂环境排障能力令人印象深刻 — rakyll · 2026-10-01
- Nous Research 桌面端 Hermes Desktop 演示引发关注 — Teknium · 2026-10-01
- 爆料称 Google Gemini 4 Argon 单次可输出 100 万 token,基准全面领先 — rohanpaul_ai · 2026-10-01