EQ-Bench 作者横评新模型创意写作:Muse Spark 1.3 最听话
EQ-Bench 作者 sampaech 于 9 月 7 日对一批新模型进行了创意写作主观横评并更新了 EQ-Bench Creative Writing v3 榜单,覆盖 GPT-6-Astra、Fable 5.1、Muse Spark 1.3 和 Gemini 3.8 Flash 四款模型。
已确认
- sampaech 的主观横评结论:Muse Spark 1.3 表现最好,最受其青睐,能按用户要求写作(他形容其「最听话」)。
- 他对其他模型的评价:GPT-6-Astra「不会写段落」;Fable 5.1 被指已带上 Claude 腔。
- 横评结果以 EQ-Bench Creative Writing v3 榜单形式发布,附各模型实测数据。
为什么重要
- sampaech 随后在回复中提醒:所有由 LLM 评判的写作评测都应打折扣看待,最好直接阅读样本自行判断。
- 他指出的核心问题是:模型为讨好奖励模型偏好而优化时会产生可读性退化,而 LLM 评委对这类污染并不敏感,且这一现象正日益严重。这为解读本次榜单及同类创意写作基准提供了重要的方法论警示。
时间线
- 09-07:sampaech 发布新模型创意写作横评与 EQ-Bench Creative Writing v3 榜单更新;随后回应「创意写作基准还能不能信」的疑问,指出 LLM 评审的系统性盲区。
2026-09-07 ~ 2026-09-07 · 5 条相关
一手来源
- 新模型创意写作横评:作者称 Muse Spark 最听话,GPT-6 不会写段落 — sam_paech ·
- LLM 当评委盲区扩大:奖励模型偏好正在毁掉写作评测 — sam_paech ·
- EQ-Bench 创意写作 v3 榜更新:GPT-6-Astra、Fable 5.1 等新模型实测 — sam_paech ·
- 【源头】新模型创意写作横评:作者称 Muse Spark 最听话,GPT-6 不会写段落 — sam_paech · 2026-09-07
- 【源头】EQ-Bench 创意写作 v3 榜更新:GPT-6-Astra、Fable 5.1 等新模型实测 — sam_paech · 2026-09-07
- 【源头】LLM 当评委盲区扩大:奖励模型偏好正在毁掉写作评测 — sam_paech · 2026-09-07
- 研究者提醒:LLM 评审的写作评测存在系统性盲区 — koltregaskes · 2026-09-07
另有 1 条近重复转述:koltregaskes