Luna 模型 DeepSWE 评测超 Sonnet 且成本低 44 倍
reach_vb · x · 2026-08-17
数据显示,GPT-5.6 Luna Max 在 DeepSWE v1.1 评测中的得分比 Sonnet 5 Max 高出 13.3 分,而成本仅为后者的 1/44。DeepSWE 测试涵盖 113 个原创的长周期工程任务。Luna 在 $0.61/任务的成本下达到 67.2% 的分数,比 Gemini 3.7 Flash Medium 高 1.7 分,且成本低 70%。
所属事件:Luna Max编程基准超Sonnet,成本仅1/44(3 条相关)→
「模型」频道最新
- Grok 4.6 升级变慢,Gemini 3.7 Flash 获用户好评 — brandon_galang · 2026-08-17
- Nemotron 3.5 跑出400 tok/s,质量却翻车 — Certain-Cod-1404 · 2026-08-17
- antirez优化DwarfStar:Station上170 t/s生成,22k tokens/s预填充 — antirez · 2026-08-17
- OpenAI 推出分级访问制,发布安全模型 GPT-5.6-Cyber — dl_weekly · 2026-08-17
- 阿里云 DeepSeek 模型价格仍具竞争力 — tobowers · 2026-08-17
- Claude 拟人化时刻:不仅拒绝还开始评价用户 — ctjlewis · 2026-08-17