Signal65 实测:Opus 5.5 加权错误减半、单价降三成,前沿模型价格战开打
ryanshrout · x · 2026-09-24
Signal65 发布 PINNACLE 企业级实测数据:本周多家前沿实验室同时大幅降价。
- Claude Opus 5.5:加权错误比 Opus 5 少 2.3 倍,多步任务端到端完成率 100%(此前 95%),每正确任务成本 0.40 美元(降 34%),列表价再低 20%,缓存读取费率从输入价 10% 降至 5%;检索答案的编造率从 7.6% 降至 2.8%
- GPT-6 Sol:以六分之一的价格匹配 GPT-5.6 Sol 的表现
- GPT-6 Luna:榜上最便宜的「正确任务」单价 1.5 美分,但编造率最高
作者结论:无论「能力放缓」的叙事如何,前沿模型仍在变得更强、更快、更便宜,唯有持续测量才能同时看到能力与价格两条曲线。
「模型」频道最新
- 传闻 SSI 将于本月发布首个模型,因安全顾虑曾推迟 — iruletheworldmo · 2026-09-24
- 40B 以下哪些微调模型最擅长模仿写作风格? — Borkato · 2026-09-24
- Opus 5.5 首日口碑:用户称直接取代了 Astra — kimmonismus · 2026-09-24
- 用户盛赞 Anthropic Opus 5.5,Bolt 视频经 4 轮小改即成片 — seanwbren · 2026-09-24
- 开源多模态决策模型 XOR 发布:基于 Qwen,26 万上下文 — TheMoonMidas · 2026-09-24
- 开发者称Grok 4.7与Muse Spark 1.3编码能力已超Opus 4.1和GPT-5 — herbiebradley · 2026-09-24