审计发现三大 AI 基准有假:SWE-Bench Pro 约 30% 任务损坏

geoffwolfe · x · 2026-10-11

有人指出:基准分数可以在模型完全不变的情况下上涨,评估工具本身需要像模型一样被审计,否则「更好的打分」会被误读成「更强的智能」。

核心结论:坏掉的评估器既能隐藏真实能力,也能凭空制造突破,基准审计应成为常态。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →