GPT-5.6 超越 Sonnet 且成本极低
reach_vb · x · 2026-08-16
评测显示,GPT-5.6 Luna Max 在 DeepSWE v1.1 上得分比 Sonnet 5 Max 高出 13.3 分,但成本仅为后者的 1/44。DeepSWE 测试包含 113 个长周期工程任务。
所属事件:Luna Max编程基准超Sonnet,成本仅1/44(3 条相关)→
「模型」频道最新
- Looped Transformers 成研究新热,Kye Gomez 称早被自己押中 — KyeGomezB · 2026-10-02
- 每月 400 美元买哪个 Agent?网友提议让它们同城对抗实测 — nick_linck · 2026-10-02
- fastino 发布 GLiDE:首个按需思考的决策模型,Decision Index 登顶 — kalyan_kpl · 2026-10-02
- Anthropic 自述:从 Sonnet 5 的「难聊」到 Fable 5.1 找回经典 Claude 手感 — every · 2026-10-02
- 1565 封邮件实测:Perplexity 与 Cloudflare 决策模型比拼 — michellechen · 2026-10-02
- 两张 96GB 昇腾卡本地跑 Qwen:从 1 tok/s 调到 30 tok/s 全记录 — matteiuspi · 2026-10-02