IBM新研究:措辞变化致LLM基准分波动高达74.7个百分点
rohanpaul_ai · x · 2026-08-20
IBM 新论文提出 BenchDrift 审计框架,通过在不改变答案的前提下系统改写问题,测量模型得分因措辞变化的波动。在 8 个模型和 3 个基准上,最好与最差准确率平均差距达 74.7 个百分点,且更强的模型受影响更大。对于基线准确率高于 60% 的模型-基准组合,改写破坏的正确回答多于恢复的。即使在最高置信度区间,仍有 18.5% 的正确回答因改写而丢失。论文建议模型选择时测试多种等价表述或报告范围。
「研究」频道最新
- 伯克利提出 CLIFT 法,闭源模型也能闭环微调人形机器人 — keerthanpg · 2026-08-20
- PolymathicAI 发布 15TB 物理模拟数据集 The Well — tom_doerr · 2026-08-20
- 机器学习理论家迎变局,GPT-5.6 Sol 自动化优化研究 — aaron_defazio · 2026-08-20
- Yoav Goldberg 探讨新一代检索增强机制与原始 RAG 区别 — yoavgo · 2026-08-20
- FDA 批准 1357 款医疗 AI,仅 3 款验证患者获益 — EricTopol · 2026-08-20
- 研究者让 Codex 处理随机试验数据,它主动要求对自身设盲 — Afinetheorem · 2026-08-20