DeepSWE v1.1 长程编程评测:Gemini 4 领先 Opus 5.5 与 GPT-6
rohanpaul_ai · x · 2026-10-01
rohanpaulai 援引 DeepSWE v1.1 的测试结果称,在考察长程、多步软件工程能力的评测中,Gemini 4 Argon 排名领先,超过 Claude Opus 5.5 和 GPT-6 Astra。该评测专门衡量模型在多步骤工程任务中的持续表现,是观察前沿模型编码能力格局的一个参照点。
「模型」频道最新
- 曝 Google Gemini 4 在编码等关键领域表现挣扎 — ChrisGPT · 2026-10-01
- Gemini 4 被 cua-bench 实测拖后腿:游戏操控表现「尖刺化」 — burny_tech · 2026-10-01
- Harvey 法律基准现数据打架:Argon 19.6% 对 25.42% — 3scorciav · 2026-10-01
- 爆料称谷歌 Gemini 4 Argon 已悄然上线,速度远超预期 — Dr_Singularity · 2026-10-01
- 3.6B 本地模型 TwIL-LM3-Pro 形式逻辑碾压 VibeThinker-3B 达 35% — rohanpaul_ai · 2026-10-01
- 实测:Sol 6.1 推理速度比 Opus 慢近 6 倍,但 token 效率更高 — RexDouglass · 2026-10-01