按 token 便宜不等于按任务便宜,主流模型性价比实测对比
Wsz2020 · reddit · 2026-09-23
发帖人借 Anthropic 发布 Opus 5.5 之际,基于 Artificial Analysis Intelligence Index v4.3.2 做了「单价 vs. 单任务成本」的可视化对比。
要点:
- 提高 effort 等级会让 Opus 5.5 更聪明,且它是唯一落在「最佳性价比」象限的模型。
- 但换一个视角看单任务消耗 token:ChatGPT 的 Astra 模型在 xhigh 档也进入绿色区,在 medium/high effort 下能与 Opus 5.5 竞争。
- 「便宜但弱」象限的模型只有在你有办法保证结果准确时才值得买。
结论:per-token 定价与 per-task 实际成本严重脱节,选模型要看任务口径而非单价。
「模型」频道最新
- Steve Yegge 试用 GPT-6 Astra:文笔惊艳但全程莽撞 — Steve_Yegge · 2026-09-23
- 网友晒「Opus 5.5」单独跑 agent 实测,版本号真实性存疑 — alvelda · 2026-09-23
- 同一 Prompt 对决:Opus 5.5 vs GPT 6 Astra 实时 3D 樱花山谷 — dotey · 2026-09-23
- signull:OpenAI 比任何实验室都更有效地压低了高质量智能的成本 — signulll · 2026-09-23
- Reddit 用户实测 Opus 5.5 直呼离谱:编码基本被解决了 — rocket_zen · 2026-09-23
- 圈内传闻:有人称 Opus 3.5 直接变成了 Opus 4,真伪存疑 — repligate · 2026-09-23