研究揭示 LLM 评测多次投票去噪效果有限

Ege Altan 的最新研究指出,业界常通过多次运行大模型评测并取多数票来提升结果可信度,但实际去噪效果有限。其核心在于“错误相关性”陷阱:LLM 评委往往在相同问题上重复出错。例如,80%准确率的模型运行9次理论上能提升准确率,但由于错误相关,人类标注在当前依然不可替代。

2026-07-30 ~ 2026-07-30 · 2 条相关