EQ-Bench 创意写作 v3 榜更新:GPT-6-Astra、Fable 5.1 等新模型实测
sam_paech · x · 2026-09-07
sampaech(EQ-Bench 作者)测试了新模型在创意写作上的表现,涵盖 GPT-6-Astra、Fable 5.1、Muse Spark 1.3、Gemini 3.8 flash,并附 EQ-Bench Creative Writing v3 排行榜(LLM 评委打分,含 Slop Score 与 Repetition 指标)。
作者主观评价:
- 强烈偏好 Muse Spark 1.3:它按你的要求写,没有强加的「官腔风格」(house style)。
- Fable 已收敛出自己的「claudeslop」味,没法正常写作。
- GPT-6-Astra 则忘了怎么平实地写。
所属事件:EQ-Bench 作者横评新模型创意写作:Muse Spark 1.3 最听话(5 条相关)→
「模型」频道最新
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07
- 实测者泼冷水:Astra 展示力强,多步研究推理仍差一步 — xiaosun86 · 2026-09-07
- GPT-6 Astra 生成导弹规避模拟视频,能力惊人 — algo_diver · 2026-09-07
- 实测质疑 Astra 热捧:演示惊艳,多步推理仍常差一步 — xiaosun86 · 2026-09-07
- 曝 GPT 6 Blender 能力靠时薪 5 美元的非洲外包标注员训练 — Firm-Ad-2446 · 2026-09-07
- 模型状态页放弃「濒危」标签:最新 Gemini 比 Sonnet 3 更易下架 — repligate · 2026-09-07