实测 GPT-5.6 Luna:知识工作表现比肩 Sol,成本大幅降低
BenBajarin · x · 2026-08-01
科技分析师 Ben Bajarin 基于 Creative Strategies Bench 的评测方法指出,GPT-5.6 Luna (xhigh) 在知识工作场景下的表现已与 Sol (xhigh) 相当,但单次任务成本远低于后者。
他表示将把日常主力模型切换为 Luna,并考虑将其应用于包括重度知识工作在内的所有任务中。
「模型」频道最新
- 实测Claude Opus隐藏提示词,生成诡异“Dario与Amanda”图像 — chicametipo · 2026-08-01
- 开源模型逼宫?网友调侃某厂商因DeepSeek被迫降价80% — InternationalGap3698 · 2026-08-01
- 实测:用 Prompt 让 Claude 写代码构建骨骼动画系统 — chongdashu · 2026-08-01
- 18家主流大模型API价格横评:同等工作负载成本相差百倍 — mentorperplexed · 2026-08-01
- 18个大模型API成本对比:最高相差超百倍 — mentorperplexed · 2026-08-01
- 用户吐槽 Claude Opus 5 体验翻车:新版反而更难用 — vivekhaldar · 2026-08-01