Greg Kamradt 质疑 GameDevBench:平均改 4.7 个文件,更像工程任务

GregKamradt · x · 2026-09-10

针对 GPT-6-Astra 登顶 GameDevBench 的讨论,AI 领域知名人物、Arc Prize 组织者 Greg Kamradt 表示自己对基准任务不熟,随手翻了第一条任务的 README:参考方案平均要编辑 4.7 个文件、114 行代码、横跨 3.2 种文件类型。他指出自己原以为这个基准是「开发游戏」,但看任务形态更像软件工程任务,公开质疑该基准对「游戏开发能力」的测量是否名实相符。

所属事件:GPT-6-Astra 登顶 GameDevBench 引发基准质疑(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →