实验:LLM 评委级联最多仅提升 2 分,错误相关是主因
deliprao · x · 2026-09-26
Delip Rao 报告其实验结果:即使调好置信度阈值,级联(cascade)相比用 cross-fitted 阈值的最佳单一评委最多只提升 1.5 分,即使用 oracle 阈值也最多 2.0 分。级联到「陪审团」式评委集成同样收效甚微,原因是所有模型都犯高度相关的错误。
所属事件:实验揭示 LLM 评委错误高度相关,级联收益有限(3 条相关)→
「研究」频道最新
- ACuRL:零人类数据让计算机使用智能体持续适应环境 — ysu_nlp · 2026-09-26
- 数学家 Tivadar Danka 总结 20 年生涯最重要的 10 条心得 — TivadarDanka · 2026-09-26
- GPT-6 Luna 比 5.6 更省推理 token,难题两者都栽 — mhmazur · 2026-09-26
- 去像素重建做世界模型:对比式世界模型只用潜空间训练 — bonniesjli · 2026-09-26
- 首次绘出雄性果蝇全脑连接组,16.6万神经元逐个标注 — burny_tech · 2026-09-26
- 研究者用 LLM 聚类论文,预判未来将现可分离的「AI 垃圾论文」簇 — joelbot3000 · 2026-09-26