研究指 LLM 评测多次投票去噪效果有限,人类标注仍不可替代

randal_olson · x · 2026-07-30

一项针对大模型评测方法的研究指出,业界常用的「多次运行取多数答案」的容错技巧实际效果并不理想。

假设评分模型本身准确率为 80%,理论上运行 9 次并取多数票应能将准确率提升至 98%。但实测发现,由于模型在每次运行中往往会在相同的边缘案例上犯错,实际准确率仅能提升至 84.5%。作者强调,解决这一问题的根本途径依然是引入人类标注数据,并给出了所需标注量的测算方法。

所属事件:研究揭示 LLM 评测多次投票去噪效果有限(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →