实验揭示 LLM 评委错误高度相关,级联收益有限

Delip Rao 发布实验结果:即使调优置信度阈值,级联 LLM 评委相比最佳单一评委最多仅提升约 1.5 分。关键数据显示,在最自信的错误上,96% 的 LLM 评委会重复同样的错误,而错误独立时理论值应约 50%。这与 ICML 2025 中 Kim 等人分析 350 多个模型的发现一致:更大、更准确的模型犯的错误高度相关,根源在于错误相关性。

2026-09-26 ~ 2026-09-26 · 3 条相关