Luna Max 评测:成本仅为 Sonnet 2.3%,性能领先 13 分
reach_vb · x · 2026-08-17
在 DeepSWE v1.1 基准测试中,GPT-5.6 Luna Max 得分比 Sonnet 5 Max 高出 13.3 分,而成本仅为后者的 1/44。DeepSWE 测试包含 113 个原始长周期工程任务。Luna 的通过率为 67.2%,单任务成本 $0.61,比得分 70% 的 Gemini 3.7 Flash Medium 便宜 70%。
所属事件:Luna Max编程基准超Sonnet,成本仅1/44(3 条相关)→
「模型」频道最新
- Claude 拟人化时刻:不仅拒绝还开始评价用户 — ctjlewis · 2026-08-17
- Grok 第一性原理分析莱特兄弟帖引关注 — doodlestein · 2026-08-17
- 实测 Qwen 3.8-27B 长思考模式:规划阶段耗尽 5 万 tokens — LippyBumblebutt · 2026-08-17
- 实测 Grok 4.6 编码:核心逻辑强但边界处理粗糙 — jquinonero · 2026-08-17
- Opus 近期频繁出错,表现过于顺从 — nathanbenaich · 2026-08-17
- Anthropic 报告泄密:内部模型 Model 2 能力超 Mythos 5 — koltregaskes · 2026-08-17