写作评测暗藏刷分漏洞:逐样本 rubric 或被训练过程反向拟合

teortaxesTex · x · 2026-09-30

sampaeth 讨论 LLM 自然写作评测的方法论隐患:为每个样本定制超具体的评分 rubric 虽能增加区分度,但也让评测更容易被「不越线的过拟合」钻空子——模型可以学到「遇到某种 prompt 就迎合特定评分标准」的启发式。

他指出实验室常见的 benchmax 手法:生成接近测试集分布的合成数据,再用同一个 grader 做 RL,最终评测衡量的可能不再是写作能力,而是训练过程对隐藏评分目标的发现程度。teortaxesTex 转发称这是关于自然写作评测的「real alpha」。可能的对策是直接公开评分 rubric。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →