研究揭示大模型存在统计自洽性缺陷

Patrik Wolf · hf · 2026-07-17

**研究核心** 当前大语言模型(LLM)的上下文学习常被视为一种条件推断,但模型输出是否符合基础的概率恒等式?本文探讨了 LLM 估计是否遵循统计自洽性原则。 **实验方法** - 使用二叉树作为评估框架,将总体递归划分为更细的子群体。 - 通过提示词向模型输入子群体描述,获取估计值后聚合,并与不同粒度下的总体估计进行对比。 **关键发现** - **自洽性违背**:在最前沿模型和多个问题领域中,观察到模型广泛违反了基本的概率一致性属性。 - **宏观谬误**:从细粒度子群体重构的估计值,往往比直接让模型给出的总体估计更符合人类参考数据。这表明模型拥有相关的子群体知识,但无法可靠地将其推演到全局聚合估计中。 **结论** 这种概率推演上的断层表明,统计自洽性是评估大模型的一个尚未饱和且无需标准答案的全新维度。

所属事件:研究揭示大模型存在统计自洽性缺陷(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →