研究揭示 LLM 评测多次投票去噪效果有限
Ege Altan 的最新研究指出,业界常通过多次运行大模型评测并取多数票来提升结果可信度,但实际去噪效果有限。其核心在于“错误相关性”陷阱:LLM 评委往往在相同问题上重复出错。例如,80%准确率的模型运行9次理论上能提升准确率,但由于错误相关,人类标注在当前依然不可替代。
2026-07-30 ~ 2026-07-30 · 2 条相关
- 研究指 LLM 评测多次投票去噪效果有限,人类标注仍不可替代 — randal_olson · 2026-07-30
- 重复跑评测并不能提升准确率,研究揭示 LLM 评委的「错误相关性」陷阱 — randal_olson · 2026-07-30