Luna Max 评测:成本仅为 Sonnet 2.3%,性能领先 13 分

reach_vb · x · 2026-08-17

在 DeepSWE v1.1 基准测试中,GPT-5.6 Luna Max 得分比 Sonnet 5 Max 高出 13.3 分,而成本仅为后者的 1/44。DeepSWE 测试包含 113 个原始长周期工程任务。Luna 的通过率为 67.2%,单任务成本 $0.61,比得分 70% 的 Gemini 3.7 Flash Medium 便宜 70%。

所属事件:Luna Max编程基准超Sonnet,成本仅1/44(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →