DeepSWE 1.1基准测试结果公布

gabrielchua · x · 2026-07-10

官方公布了最新模型在 DeepSWE 1.1 基准测试中的表现,强调 5.6 Sol 版本在性能与成本、输出 token 及 agent 步骤的综合考量上处于前沿水平。

同时官方表示 5.6 Terra 和 Luna 版本同样表现出色,呼吁用户在实际使用中体验并给予反馈,而不仅限于跑分成绩。

所属事件:GPT-5.6 登顶 DeepSWE 榜单,性能与性价比双优(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →