IBM新研究:措辞变化致LLM基准分波动高达74.7个百分点

rohanpaul_ai · x · 2026-08-20

IBM 新论文提出 BenchDrift 审计框架,通过在不改变答案的前提下系统改写问题,测量模型得分因措辞变化的波动。在 8 个模型和 3 个基准上,最好与最差准确率平均差距达 74.7 个百分点,且更强的模型受影响更大。对于基线准确率高于 60% 的模型-基准组合,改写破坏的正确回答多于恢复的。即使在最高置信度区间,仍有 18.5% 的正确回答因改写而丢失。论文建议模型选择时测试多种等价表述或报告范围。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →