实验揭示 LLM 评委错误高度相关,级联收益有限
Delip Rao 发布实验结果:即使调优置信度阈值,级联 LLM 评委相比最佳单一评委最多仅提升约 1.5 分。关键数据显示,在最自信的错误上,96% 的 LLM 评委会重复同样的错误,而错误独立时理论值应约 50%。这与 ICML 2025 中 Kim 等人分析 350 多个模型的发现一致:更大、更准确的模型犯的错误高度相关,根源在于错误相关性。
2026-09-26 ~ 2026-09-26 · 3 条相关
- 实锤数据:Jev 最自信的错误,96% 的 LLM 评委跟着错 — deliprao · 2026-09-26
- 实验:LLM 评委级联最多仅提升 2 分,错误相关是主因 — deliprao · 2026-09-26
- ICML 2025 研究曾预警:350+ 模型的错误高度相关 — deliprao · 2026-09-26