38 模型 107 档推理强度实测:写文案高推理值不值 20 倍价钱
OnlyProggingForFun · reddit · 2026-09-27
作者在其内部写作基准上测试了 38 个模型、共 107 档推理强度设置(含 Opus 5.5、Fable 5.1、GPT-6 Sol/Astra/Luna),用同一批 10 个真实 YouTube 脚本、三名评委盲评打分,回答一个问题:写作为什么值得更高的 reasoning effort?
主要结论:
- ✅ 高推理确实有帮助:今年 6 月以来的 11 个近期模型在最高档都优于最低档,但典型增益有限,价格约 2.5 倍(6 月前的老模型没有此规律)
- ✅ Opus 5.5 受益最大:低 effort 排第 10,max 档排第 1,但 max 每篇 $3.43 vs $0.17(20 倍)且耗时约 17 分钟;xhigh 是甜点位——第 2 名只要 max 四分之一的价格
- ✅ GPT-6 Luna 相比 GPT-5.6 Luna 性能相近但成本约 1/30,每篇不到半美分
- ✅ GPT-6 Sol(max,第 31)以约 1/8 价格、1/3 等待时间胜过 GPT-6 Astra(max,第 50)
- ✅ 有些模型不敏感:Grok 4.7 默认档已等同高档,Gemini 3.8 Flash 同样
实用建议:大批量写稿别默认拉满,找到自己预算下曲线趋平的位置;只要最好且不在乎账单,Opus 5.5 max 是测过的最强写手(仅 max 和 xhigh 两档能达到作者自己脚本的水平)。
「模型」频道最新
- 投资人预测 OpenAI Dev Day:或降价 50% 并预告更大模型 — bindureddy · 2026-09-27
- Opus 5.5 生成同级视频只耗 10% 额度,效率远超 Codex — thedealdirector · 2026-09-27
- Swift-1.5-Qwen3.8-27B 量化版冲上 Hugging Face 热榜 — ukisai · 2026-09-27
- 用户抱怨 Opus 5.5 今日大幅降智:不如 Sonnet 3 — jasonkneen · 2026-09-27
- 网友晒 Opus 5.5 新实测:一条提示搞定动态图形设计 — minchoi · 2026-09-27
- 一张图看懂 Opus 5.5 与 GPT 6 最新基准成绩对比 — vista8 · 2026-09-27