亚马逊研究:用 Ising 模型提升 LLM 评判准确性
DocXavi · x · 2026-08-29
Amazon Science 发布研究,探讨当 LLM 评判者意见一致时是否可信。
- 问题背景:共享提示词、同族模型或训练谱系可能导致“多数票”看起来比实际更强。
- 解决方案:提出一种基于依赖感知的聚合方法,利用 Ising 模型考虑评判者之间的依赖关系。
- 实验结果:该方法在准确性上比加权多数投票提高了 9%–14%。
- 核心观点:盲目相信一致性可能导致偏差,需要更复杂的聚合策略来修正。
「研究」频道最新
- 周末资源:从第一性原理推导位置编码 — zainhas · 2026-08-30
- COLM 论文用梯度归因揭示 LLM 能力来源 — ziv_ravid · 2026-08-30
- Toby Ord 论文指递归自我改进受物理限制 — Exponential View (Azeem Azhar) · 2026-08-30
- Fable 与 Sol 形式化验证文献,首次找出论文可修复错误 — Sauers_ · 2026-08-30
- Mark Schmidt 发布 ICML 教程视频:数值优化理论在 2026 年还重要吗 — MarkSchmidtUBC · 2026-08-30
- 46 行 Python 实现 SDF 甜甜圈渲染 — voooooogel · 2026-08-30