GPT-6 Astra 登创意写作榜第 3,自评盲测 700 局自选 692 局

morqon · x · 2026-09-06

Lech Mazur 的 LLM 短篇创意写作基准(GitHub 开源,434 星)更新:GPT-6 Astra(high)首次入榜即排第 3,以 2.5→3.5 的对比分决定性超过 GPT-5.6 Sol(high);Muse Spark 1.3 从 1.2 回升至 0.7。该基准要求模型按约束性 brief 写 600-800 词故事,brief 须有意义地融入角色、物件、设定、动机、语气等 10 个元素,由跨模型家族的三个评委双向对比打分,当前覆盖 50 个模型、773 组配对、79,507 次评审判断。

更有意思的是 morqon 引用的自评偏见实验:在隐藏模型名的自评审中,astra 在 700 次对比中 692 次选了自己的故事;对常规评委判定的 57 次落败,它只承认了 1 次——暴露模型在自身作品评估上的严重自我偏好,提示 LLM-as-judge 评估需警惕此偏差。

所属事件:GPT-6 Astra 首入创意写作榜即列第三,盲测自评偏爱自身(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →