创意写作基准更新:覆盖 56 模型、超 10 万条评审判定
zero0_one1 · reddit · 2026-09-29
Short-Story Creative Writing Benchmark 发布新一轮结果,现已覆盖 56 个模型、102,592 条评审判定:
- Opus 5.5 (high) 从 Opus 5 的 3.5 升至 3.8,仅次于 Fable 5.1 (high) 与 Opus 5 (xhigh)。
- Grok 4.7 (high) 大幅进步:-2.8 → 0.4;MiMo V2.6 Pro (thinking) 从 -0.7 升至 1.6;Gemini 3.8 Flash (high) 从 -0.7 升至 0.2;DeepSeek V4.1 Flash 首次入榜得 -0.5。
- 基准测试方式:给定约束 brief(须包含角色、物品、场景、动机、语气等 10 个要素),模型写出 600-800 词完整短篇;由来自不同模型家族的三名评委打分,故事对以两种顺序展示以消除位置偏差,评委不评自家家族的作品。
- 评分维度包括文笔、原创性、连贯性、人物塑造及各要素的协同效果。
「模型」频道最新
- 重度用户一周烧掉 1.7 亿 tokens:GPT 5.5 让他倒向 OpenAI — ChrisUniverse · 2026-09-29
- Every 实测 Claude Sonnet 5.5:比 Sonnet 5 快 30% 且更便宜 — danshipper · 2026-09-29
- 用户实测:切换 Claude Opus 5.5 后再没回头用过 Fable 5.1 — haider1 · 2026-09-29
- Sonnet 5.5 发布获「Opus 级」升级,写作能力反超旗舰 — every · 2026-09-29
- 实测 Jev 跑推理密集型回归任务:快但准头一般 — dbreunig · 2026-09-29
- 一年后再画同题画作,网友感叹 Claude 模型艺术功力大增 — IllustriousWorld823 · 2026-09-29