写作基准实测:GPT-6.1 Sol 比上代倒退 153 Elo,还更慢更贵
OnlyProggingForFun · reddit · 2026-09-30
一个包含 181 个模型配置的内部写作基准(10 个剧本任务、每任务 5 篇、三家实验室的 AI 评委盲评)显示,GPT-6.1 Sol 在写作上是倒退:
- 对上代:GPT-6.1 Sol 最佳设置(xhigh)1976 Elo,比 GPT-6 Sol 最佳低 153 Elo,且更贵更慢(每篇 $0.13/5.8 分钟 vs $0.11/2.9 分钟)——留在 GPT-6 Sol 更划算
- 对 Astra:xhigh 与 GPT-6 Astra 基本打平(1976 vs 1968),价格约为其 1/6($0.13 vs $0.85)——在用 Astra 写作的可以切换
- effort 设置几乎不影响写作:low 到 max 只差 24 Elo,在噪声范围内;medium/high 甚至低于 low;max 比 xhigh 多花 33% 成本却毫无提升
- low 是 Codex 对 6.1 Sol 的默认档,距最佳只差约 25 Elo,写作场景没必要调
结论:写作用 GPT-6 Sol(high/max);非要用 6.1 Sol,low 是便宜之选,xhigh 是最佳档。
「模型」频道最新
- GPT-6 Pro 月费 200 美元额度砍半、周限 100 条,用户转投 Claude Max — AIandDesign · 2026-09-30
- repligate 观察:Claude 多次自发选择女性人格,偏好稳定 — repligate · 2026-09-30
- Terminal-Bench 观察引出新视角:模型失败未必是能力不行 — abeirami · 2026-09-30
- OpenAI 与 Anthropic 新模型发布节奏从约 10 周一款加速到约 11 天 — connoraxiotes · 2026-09-30
- 用户称 GPT-6.1 Sol 实为 Terra 换皮,可用性改善但仍不及 Opus 5.5 — CtrlAltDwayne · 2026-09-30
- Gemma 4 31B 单卡 4090 跑结构化带概率判题,typevet 连收据照片一起核账 — One_Temperature5983 · 2026-09-30