GPT-6-Astra 登顶 GameDevBench,但分数低得令人意外
sethkarten · x · 2026-09-09
GPT-6-Astra 成为 GameDevBench(游戏开发基准)新的第一名,Wayne Chi 指出考虑到 Twitter 上大量称赞其游戏开发能力的声音,这并不意外,惊叹模型进步速度之快。但引用者 sethkarten 表示反差:他原本预期更高的原始分数,认为「游戏开发还远未被解决」。两者共同指向:即便最强模型登顶,离真正自动做出游戏仍有明显差距。
所属事件:GPT-6-Astra 登顶 GameDevBench 引发基准质疑(3 条相关)→
「模型」频道最新
- Terminal Bench 4.0 被点名:少数排名真实反映能力的评测 — JJitsev · 2026-09-10
- ElevenLabs 联创长谈:AI 原生组织与语音生态打法 — JenniferHli · 2026-09-10
- Mollick:开源模型与前沿差距拉大到近年之最 — emollick · 2026-09-10
- 仅2B参数登顶小模型榜:MiniCPM5支持工具调用与多步任务 — solyarisoftware · 2026-09-10
- ChatGPT 语音模式限额调整:Plus 3 小时,Pro 15 小时 — testingcatalog · 2026-09-10
- 新基准 VDiff-Bench:1756 题暴露前沿模型找不同能力短板 — yixin_wan_ · 2026-09-10