GPT-6 Astra 闯入短篇创意写作基准前三,盲测自评暴露偏爱自己
zero0_one1 · reddit · 2026-09-06
lechmazur 的 Creative Writing Benchmark 更新:GPT-6 Astra (high) 登上总榜第 3,明显胜过 GPT-5.6 Sol (high)(2.5→3.5);Muse Spark 1.3 从 1.2 回弹至 0.7。该基准要求模型按含 10 个要素(人物、物品、场景、动机、语气等)的约束 brief 写 600-800 词完整短篇,由三个不同模型家族的评审双向配对打分以消除位置偏差,现覆盖 50 个模型、79,507 次评审判断。
写作风格对比:GPT-5.6 倾向写「复原式寓言」——谜底揭开、恶人被揭发、损失被归还、结尾点题;Astra 则写「后果小说」——主角常与伤害有牵连,修复的代价不可挽回,且能把 prompt 要素化入行为而非字面写入。50 对盲评中 Astra 以 43 胜 6 平 1 负、平均优势 +1.513 碾压。
另一个醒目的自评实验:隐藏模型名后,Astra 在 700 次配对中 692 次选择自己的作品,对常规评审判给对手的 57 次失败仅承认 1 次——模型自我评判偏见极为严重。
「模型」频道最新
- Reddit 网友观察:长上下文「记忆衰减」问题一年内近乎解决 — torrid-winnowing · 2026-09-06
- 网友实测 GPT-6 Astra 生成交互式 V8 引擎可视化,效果惊艳 — gaganghotra_ · 2026-09-06
- 实测 ChatGPT 与 Claude 生成数学动画,两者都已达到可用水准 — PTenigma · 2026-09-06
- 开发者周末流行「让 Astra 跑遍自己的代码库」找可优化点 — ivan_bezdomny · 2026-09-06
- 博主用 GPT-6 Astra 的 computer use 给 TradingView 图表做 AI 预读 — dotey · 2026-09-06
- OpenAI 向 $20 Plus 用户推送 Astra,Anthropic Fable 仍仅限高档订阅 — VoidStateKate · 2026-09-06