研究指 LLM 评测多次投票去噪效果有限,人类标注仍不可替代
randal_olson · x · 2026-07-30
一项针对大模型评测方法的研究指出,业界常用的「多次运行取多数答案」的容错技巧实际效果并不理想。
假设评分模型本身准确率为 80%,理论上运行 9 次并取多数票应能将准确率提升至 98%。但实测发现,由于模型在每次运行中往往会在相同的边缘案例上犯错,实际准确率仅能提升至 84.5%。作者强调,解决这一问题的根本途径依然是引入人类标注数据,并给出了所需标注量的测算方法。
所属事件:研究揭示 LLM 评测多次投票去噪效果有限(2 条相关)→
「研究」频道最新
- LLM 推理提效实为“过训练”?掩码蒸馏机制深度解析 — rao2z · 2026-07-31
- AI生图检测准确率降至38%,人类视觉图灵测试引关注 — saheedniyi_02 · 2026-07-31
- 深度思考:强大的 AI 数学工具可能没想象中那么颠覆 — rbhar90 · 2026-07-31
- ICLR 2027 新规:限制作者提交数量以防范学术刷榜 — JessicaHullman · 2026-07-31
- Nature 研究:国家媒体控制会显著影响大模型倾向 — steverathje2 · 2026-07-31
- PWT 稀疏注意力新法:无需微调,视频生成端到端提速 2.5 倍 — 青稞AI · 2026-07-31