Creative Writing Benchmark update: 56 models, 102,592 judgments, Opus 5.5 near top
zero0_one1 · reddit · 2026-09-29
The Short-Story Creative Writing Benchmark released new results covering 56 models and 102,592 evaluator judgments. Opus 5.5 (high) improved 3.5 → 3.8, just behind Fable 5.1 (high) and Opus 5 (xhigh). Grok 4.7 (high) jumped -2.8 → 0.4, MiMo V2.6 Pro (thinking) rose -0.7 → 1.6, Gemini 3.8 Flash (high) improved -0.7 → 0.2, and DeepSeek V4.1 Flash debuted at -0.5. Models turn constrained briefs (10 required elements) into 600-800-word stories, judged by a three-judge panel from other model families with order randomization to reduce bias.
More from Models
- Power user burns 170M+ tokens a week on ChatGPT, credits GPT 5.5 for winning him over — ChrisUniverse · 2026-09-29
- Every's vibe check: Claude Sonnet 5.5 runs 30%+ faster, up to 30% cheaper than Sonnet 5 — danshipper · 2026-09-29
- User: Claude Opus 5.5 beats Fable 5.1 on speed and quota, new Fable likely near — haider1 · 2026-09-29
- Sonnet 5.5 Ships With Opus-Level Writing Gains, But Mid-Tier Models May Be Dying — every · 2026-09-29
- Testing Jev on Reasoning-Intensive Regression: Wicked Fast but Classification-Focused — dbreunig · 2026-09-29
- Claude's art skills leveled up: Reddit user retests a year later — IllustriousWorld823 · 2026-09-29