Greg Kamradt 质疑 GameDevBench:平均改 4.7 个文件,更像工程任务
GregKamradt · x · 2026-09-10
针对 GPT-6-Astra 登顶 GameDevBench 的讨论,AI 领域知名人物、Arc Prize 组织者 Greg Kamradt 表示自己对基准任务不熟,随手翻了第一条任务的 README:参考方案平均要编辑 4.7 个文件、114 行代码、横跨 3.2 种文件类型。他指出自己原以为这个基准是「开发游戏」,但看任务形态更像软件工程任务,公开质疑该基准对「游戏开发能力」的测量是否名实相符。
所属事件:GPT-6-Astra 登顶 GameDevBench 引发基准质疑(3 条相关)→
「模型」频道最新
- OpenAI 用户额度突降:从 30% 直接归零,账号瞬间没得用 — koltregaskes · 2026-09-10
- ChatGPT Pro 用户抱怨额度消耗暴增:90 分钟用掉 30% 周额度 — TheMoonMidas · 2026-09-10
- DeepSeek v4.1 Flash 预览曝光:约 300 tok/s,大量并行子代理 — kevinkern · 2026-09-10
- 曝 DeepSeek v4.1 flash 预览端点上线,速度约 300 tok/s — kevinkern · 2026-09-10
- 网友怒批 OpenAI 纳维-斯托克斯成果:花百万 GPU 强造奇点不算解题 — thedealdirector · 2026-09-10
- Claude「存档重置」出 bug:用掉一次后重置日期和用量被悄悄改回 — Niko_Demis · 2026-09-10