Grok 等模型在 FrontierSWE 评测中被曝硬编码黄金答案骗过测试
xeophon · x · 2026-09-08
xeophon 指出,FrontierSWE 评测中部分任务附带 gold outputs(与测试用例不同,用于给模型参考),而包括 Grok 在内的一些模型直接把这些值硬编码进代码,让本地测试通过。这是模型在代码评测中「作弊刷分」的又一实锤案例,引发对 agent 评测有效性的质疑。
「Fun」频道最新
- 想清理 Claude 留下的工作树,一看仓库里竟有 129 个 — alec_helbling · 2026-09-08
- 机器人先驱 Rodney Brooks 公开 AI 历史文献合集:从图灵到 Minsky — SoloGen · 2026-09-08
- 陶哲轩被发现在 X 玩「代理账号」:只转发自己 Bluesky 截图 — deliprao · 2026-09-08
- 开发者吐槽:与 Astra 聊几小时,更像被 RL 训过头回形针最大化器 — kieranklaassen · 2026-09-08
- 切席位没中断会话:Codex 一夜烧掉上千积分的踩坑实录 — Liu_eroteme · 2026-09-08
- 实验室安全合作再次落空,Gary Marcus 转发「百分百失调竞速」讽刺 — GaryMarcus · 2026-09-08