新模型创意写作横评:作者称 Muse Spark 最听话,GPT-6 不会写段落
sam_paech · x · 2026-09-07
博主 sampaech 对多款新模型做创意写作主观横评:GPT-6-Astra、Fable 5.1、Muse Spark 1.3、Gemini 3.8 Flash。
他的结论:
- Muse Spark 1.3 最受青睐:按要求直接输出,没有强加的"自家腔调"。
- Fable 5.1 已收敛出自己的 "claudeslop" 风格,无法正常写作。
- GPT-6-Astra 则"忘了怎么写段落"。
作者半开玩笑地建议恢复一个老传统:用自己的眼睛去读模型的原始输出,而不是只看评测分数。
所属事件:EQ-Bench 作者横评新模型创意写作:Muse Spark 1.3 最听话(5 条相关)→
「模型」频道最新
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07
- 实测者泼冷水:Astra 展示力强,多步研究推理仍差一步 — xiaosun86 · 2026-09-07
- GPT-6 Astra 生成导弹规避模拟视频,能力惊人 — algo_diver · 2026-09-07
- 实测质疑 Astra 热捧:演示惊艳,多步推理仍常差一步 — xiaosun86 · 2026-09-07
- 曝 GPT 6 Blender 能力靠时薪 5 美元的非洲外包标注员训练 — Firm-Ad-2446 · 2026-09-07
- 模型状态页放弃「濒危」标签:最新 Gemini 比 Sonnet 3 更易下架 — repligate · 2026-09-07