大模型「评判对齐度」自适应调参:早期实验显示几乎全面更优

IanArawjo · x · 2026-08-13

开发者反思了此前固定的 0.4 IRR(信息检索率)经验法则,该法则基于固定收缩参数的 PPI 实现得出。

他提出了一种名为 "power tuning tuning" 的自适应方案:根据模型评判(judge)的对齐程度动态调整收缩参数 λ。早期模拟显示,这种自适应方法几乎在所有情况下都优于任何固定参数方案。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →