Luna 模型 DeepSWE 评测超 Sonnet 且成本低 44 倍
reach_vb · x · 2026-08-17
数据显示,GPT-5.6 Luna Max 在 DeepSWE v1.1 评测中的得分比 Sonnet 5 Max 高出 13.3 分,而成本仅为后者的 1/44。DeepSWE 测试涵盖 113 个原创的长周期工程任务。Luna 在 $0.61/任务的成本下达到 67.2% 的分数,比 Gemini 3.7 Flash Medium 高 1.7 分,且成本低 70%。
所属事件:Luna Max编程基准超Sonnet,成本仅1/44(3 条相关)→
「模型」频道最新
- Gemini Desktop 拟新增「完全访问」权限:可读写任意文件并操控任意应用 — testingcatalog · 2026-10-02
- 加个「畅销款」标签就翻车:三篇 NeurIPS 论文揭示 LLM 偏见 — xuandongzhao · 2026-10-02
- $500 顶级订阅几分钟耗尽周额度,用户质疑 ultrafast 模式意义 — d00m_sayer · 2026-10-02
- OpenAI 训练暂停引对比,Anthropic 曾静默暂停过训练 — JacquesThibs · 2026-10-02
- Hugging Face CEO:决策模型 Kev-4B 可在 llama.cpp 端侧免费运行 — ivan_bezdomny · 2026-10-02
- Grok Voice 登顶语音任务榜,任务成功率 94.6% 领先 GPT 与 Gemini — XFreeze · 2026-10-02