多个 LLM 评审意见一致就可信吗?Amazon Science 提出质疑

Betelbuddy · hn · 2026-09-15

Amazon Science 发文探讨 LLM-as-a-judge 的一个常见假设:多个 LLM 评审意见一致 ≠ 结论可信。文章指出 LLM 评审可能共享相同的系统性偏差——它们基于相似的基础模型和训练数据,因此「一致性」可能只是偏差的一致,而非答案正确。文中给出分析与缓解思路,提醒用 LLM 做评估时不能把跨模型一致简单当作验证信号。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →