实验:LLM 评委级联最多仅提升 2 分,错误相关是主因

deliprao · x · 2026-09-26

Delip Rao 报告其实验结果:即使调好置信度阈值,级联(cascade)相比用 cross-fitted 阈值的最佳单一评委最多只提升 1.5 分,即使用 oracle 阈值也最多 2.0 分。级联到「陪审团」式评委集成同样收效甚微,原因是所有模型都犯高度相关的错误。

所属事件:实验揭示 LLM 评委错误高度相关,级联收益有限(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →