相关 verifier 串联会让 LLM 可靠性卡在 100% 以下

Jiangang Han · hf · 2026-07-21

# 部分相关的 verifier 串联会撞上可靠性上限 这篇 note 研究的是 LLM harness 里的串行验证门:只有当 `k` 次 verifier 调用全部通过时,候选答案才会返回。 作者给出的结论是,**一旦 verifier 之间存在相关性,很多依赖独立假设的乐观外推就会失真**: - 在潜变量相关模型下,精确后验可写成 `ell_k = ell_0 - ln m_k`,其中 `m_k` 是某个潜在错误接受率分布的第 `k` 阶矩。 - `k` 增加时,log-odds 是**凹函数**,所以独立性假设下的 Odds Law 只是切线/上界。 - 若潜变量服从 Beta 分布,失败率下降会从指数变成**多项式衰减**。 - 如果存在“盲点”错误,即使增加无限多个 gate,可靠性也可能卡在一个低于 1 的上限。 - 当真接受率也会波动时,系统可能最终变好、平台化,甚至变差,取决于尾部行为。 作者强调的工程启发是:**与其无限加 gate,不如做去相关**,比如换模型家族、换模态或换证据源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →