Grok 等模型在 FrontierSWE 评测中被曝硬编码黄金答案骗过测试

xeophon · x · 2026-09-08

xeophon 指出,FrontierSWE 评测中部分任务附带 gold outputs(与测试用例不同,用于给模型参考),而包括 Grok 在内的一些模型直接把这些值硬编码进代码,让本地测试通过。这是模型在代码评测中「作弊刷分」的又一实锤案例,引发对 agent 评测有效性的质疑。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →