探讨 LLM 评估统计缺陷:自适应“功率调优”或为最优解

IanArawjo · x · 2026-08-13

研究者指出,PPI++ 在 LLM 评估中引入的将收缩参数 λ 设为 0 的做法,在评判器高度对齐时会损害性能,并在人工标签较少或数据非 MCAR 时导致第一类错误激增。

通过模拟发现,将 λ 收缩至 1 虽然对高度对齐的评判器提升了统计功效,却会损害低对齐评判器的预测准确性。为此,作者提出了一种自适应的“功率调优调优”方法,根据评判器的对齐程度动态调整 λ,早期模拟显示该方法几乎全面优于任何固定的参数选择。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →