重复跑评测并不能提升准确率,研究揭示 LLM 评委的「错误相关性」陷阱

randal_olson · x · 2026-07-30

很多人习惯通过多次运行 LLM 评测并取多数票来提升结果可信度,但 Ege Altan 的最新分析指出,这种做法效果有限。

核心问题在于错误相关性:LLM 评委往往会在相同的测试用例上反复出错。假设评委准确率为 80%,如果错误是随机的,多次运行取多数票理论上能将准确率提升至近 98%;但由于错误高度相关,实际准确率可能仅停留在 84.5% 左右。

文章通过模拟实验展示了错误相关性如何削弱重复评测的价值,并指出不同模型间的共识投票同样无法提供太多增量信息。要真正建立对评测的信任,最有效的出路仍是引入人工标注的真实数据。

所属事件:研究揭示 LLM 评测多次投票去噪效果有限(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →