IBM 研究:基准测试高分依赖措辞,强模型更脆弱

omarsar0 · x · 2026-08-16

IBM 新研究指出,模型在基准测试上的表现很大程度上取决于题目措辞。通过 BenchDrift 生成保持答案不变但改变表述的问题,研究者发现弱模型常因改写获益,而强模型反而受损更多,导致排名前列的模型往往只是恰好遇到了顺手的表述。这种脆弱性在 GSM8K、MMLU 和 MATH-Hard 等多个数据集上普遍存在,且不同模型对哪些改写方式最敏感具有高度一致性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →