写作评测暗藏刷分漏洞:逐样本 rubric 或被训练过程反向拟合
teortaxesTex · x · 2026-09-30
sampaeth 讨论 LLM 自然写作评测的方法论隐患:为每个样本定制超具体的评分 rubric 虽能增加区分度,但也让评测更容易被「不越线的过拟合」钻空子——模型可以学到「遇到某种 prompt 就迎合特定评分标准」的启发式。
他指出实验室常见的 benchmax 手法:生成接近测试集分布的合成数据,再用同一个 grader 做 RL,最终评测衡量的可能不再是写作能力,而是训练过程对隐藏评分目标的发现程度。teortaxesTex 转发称这是关于自然写作评测的「real alpha」。可能的对策是直接公开评分 rubric。
「模型」频道最新
- GPT-6 Pro 月费 200 美元额度砍半、周限 100 条,用户转投 Claude Max — AIandDesign · 2026-09-30
- repligate 观察:Claude 多次自发选择女性人格,偏好稳定 — repligate · 2026-09-30
- Terminal-Bench 观察引出新视角:模型失败未必是能力不行 — abeirami · 2026-09-30
- OpenAI 与 Anthropic 新模型发布节奏从约 10 周一款加速到约 11 天 — connoraxiotes · 2026-09-30
- 用户称 GPT-6.1 Sol 实为 Terra 换皮,可用性改善但仍不及 Opus 5.5 — CtrlAltDwayne · 2026-09-30
- Gemma 4 31B 单卡 4090 跑结构化带概率判题,typevet 连收据照片一起核账 — One_Temperature5983 · 2026-09-30