146 个模型变体创意写作评测:Opus、Fable、Kimi K3 登顶
zainhas · x · 2026-09-07
AI研究者团队对146个模型变体进行创意写作测试:10个剧本写作任务、每任务跑5次,由3名评委从语气、声音和「人类是否愿意朗读不尴尬」维度打分,目的是衡量创意写作质量而非agent或编码能力。
要点:
- 排行与EQbench创意写作榜一致,Opus、Fable、Kimi K3同样居首;某热门模型Astra未进前十
- 实用发现:sol 5.6 的 ultra 设置单价从 $0.21 翻倍到 $0.43,只换来 66 Elo,不值得开
- 额外的 thinking 模式则物有所值
「模型」频道最新
- 博主实测 muse spark 1.3:盲测难辨 Opus,性价比惊人 — shuyanzh36 · 2026-09-07
- Artificial Analysis 发布 Intelligence Index v4.2:私有测试集防刷榜 — burny_tech · 2026-09-07
- GPT 6 Astra 对比 Fable 5.1:谁更优胜难料,双模型互评效果最佳 — peterwildeford · 2026-09-07
- 传可在 Claude Code 中调用「GPT-6-ASTRA」,真实性待证实 — BLUECOW009 · 2026-09-07
- 研究者猜想:Astra 3D 建模跃升或源于强大无 CoT 能力 — a_karvonen · 2026-09-07
- AI 革命多年,为何只有 Google 推出家庭共享订阅计划 — GabGarrett · 2026-09-07