GPT-6 Astra 闯入短篇创意写作基准前三,盲测自评暴露偏爱自己

zero0_one1 · reddit · 2026-09-06

lechmazur 的 Creative Writing Benchmark 更新:GPT-6 Astra (high) 登上总榜第 3,明显胜过 GPT-5.6 Sol (high)(2.5→3.5);Muse Spark 1.3 从 1.2 回弹至 0.7。该基准要求模型按含 10 个要素(人物、物品、场景、动机、语气等)的约束 brief 写 600-800 词完整短篇,由三个不同模型家族的评审双向配对打分以消除位置偏差,现覆盖 50 个模型、79,507 次评审判断。

写作风格对比:GPT-5.6 倾向写「复原式寓言」——谜底揭开、恶人被揭发、损失被归还、结尾点题;Astra 则写「后果小说」——主角常与伤害有牵连,修复的代价不可挽回,且能把 prompt 要素化入行为而非字面写入。50 对盲评中 Astra 以 43 胜 6 平 1 负、平均优势 +1.513 碾压。

另一个醒目的自评实验:隐藏模型名后,Astra 在 700 次配对中 692 次选择自己的作品,对常规评审判给对手的 57 次失败仅承认 1 次——模型自我评判偏见极为严重。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →