重复跑评测并不能提升准确率,研究揭示 LLM 评委的「错误相关性」陷阱
randal_olson · x · 2026-07-30
很多人习惯通过多次运行 LLM 评测并取多数票来提升结果可信度,但 Ege Altan 的最新分析指出,这种做法效果有限。
核心问题在于错误相关性:LLM 评委往往会在相同的测试用例上反复出错。假设评委准确率为 80%,如果错误是随机的,多次运行取多数票理论上能将准确率提升至近 98%;但由于错误高度相关,实际准确率可能仅停留在 84.5% 左右。
文章通过模拟实验展示了错误相关性如何削弱重复评测的价值,并指出不同模型间的共识投票同样无法提供太多增量信息。要真正建立对评测的信任,最有效的出路仍是引入人工标注的真实数据。
所属事件:研究揭示 LLM 评测多次投票去噪效果有限(2 条相关)→
「编程与Agent」频道最新
- 与其抱怨 Agent 难解真实问题,不如改造项目环境 — gandamu_ml · 2026-07-31
- 让 ML 智能体适应真实世界的工程技巧 — gandamu_ml · 2026-07-31
- 开发者开源 Teams 与 Azure DevOps 的 MCP Server — jgbright-5000 · 2026-07-31
- 求助:寻找原生支持64k上下文的本地 GGUF 模型 — Inner-End7733 · 2026-07-31
- Grok Build应用上线:提示词直接生成并部署网页应用 — evilrabbit_ · 2026-07-31
- Stack Overflow 推出 Stack Internal,构建 AI 智能体知识库 — pchandrasekar · 2026-07-31