GPT-6 Astra 登创意写作榜第 3,自评盲测 700 局自选 692 局
morqon · x · 2026-09-06
Lech Mazur 的 LLM 短篇创意写作基准(GitHub 开源,434 星)更新:GPT-6 Astra(high)首次入榜即排第 3,以 2.5→3.5 的对比分决定性超过 GPT-5.6 Sol(high);Muse Spark 1.3 从 1.2 回升至 0.7。该基准要求模型按约束性 brief 写 600-800 词故事,brief 须有意义地融入角色、物件、设定、动机、语气等 10 个元素,由跨模型家族的三个评委双向对比打分,当前覆盖 50 个模型、773 组配对、79,507 次评审判断。
更有意思的是 morqon 引用的自评偏见实验:在隐藏模型名的自评审中,astra 在 700 次对比中 692 次选了自己的故事;对常规评委判定的 57 次落败,它只承认了 1 次——暴露模型在自身作品评估上的严重自我偏好,提示 LLM-as-judge 评估需警惕此偏差。
所属事件:GPT-6 Astra 首入创意写作榜即列第三,盲测自评偏爱自身(2 条相关)→
「模型」频道最新
- Astra 第二天实测:好聊、擅数据分析,空间感出色 — bindureddy · 2026-09-06
- 8GB 显存本地跑 200 tok/s:实测 6 款小模型选型指南 — TheMoonMidas · 2026-09-06
- Humanize+GPT-5.5 拿下 PutnamBench 670/672,登顶榜首 — songhan_mit · 2026-09-06
- 「Claude 解决纳维-斯托克斯」是谣言:无论文无提交,千禧奖规则也不容推文领奖 — johnseach · 2026-09-06
- SimpleBench:前沿模型平均分首次越过人类基线 — Bojackin_Around · 2026-09-06
- ChatGPT 疑似能认出用户照片,官方否认遭用户实锤质疑 — Historical-Creme-513 · 2026-09-06