IBM 研究:基准测试高分依赖措辞,强模型更脆弱
omarsar0 · x · 2026-08-16
IBM 新研究指出,模型在基准测试上的表现很大程度上取决于题目措辞。通过 BenchDrift 生成保持答案不变但改变表述的问题,研究者发现弱模型常因改写获益,而强模型反而受损更多,导致排名前列的模型往往只是恰好遇到了顺手的表述。这种脆弱性在 GSM8K、MMLU 和 MATH-Hard 等多个数据集上普遍存在,且不同模型对哪些改写方式最敏感具有高度一致性。
「研究」频道最新
- 巴基斯坦全国法院部署生成式 AI 实证研究 — soumitrashukla9 · 2026-08-16
- Starfield 动物图像数据集发布,含 2 万张图片 — eccLykta · 2026-08-16
- 信息丰裕悖论:长上下文训练反而削弱模型参数知识 — DanielKhashabi · 2026-08-16
- 新论文:miRNA 调控多细胞聚集体生物电区域化 — drmichaellevin · 2026-08-16
- Intern-S2-Mobius 解耦知识推理,数据效率大增 — jiqizhixin · 2026-08-16
- 新论文提出将“教学”视为心智理论的大挑战 — atilimgunes · 2026-08-16