DeepSWE v1.1 长程编程评测:Gemini 4 领先 Opus 5.5 与 GPT-6

rohanpaul_ai · x · 2026-10-01

rohanpaulai 援引 DeepSWE v1.1 的测试结果称,在考察长程、多步软件工程能力的评测中,Gemini 4 Argon 排名领先,超过 Claude Opus 5.5 和 GPT-6 Astra。该评测专门衡量模型在多步骤工程任务中的持续表现,是观察前沿模型编码能力格局的一个参照点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →