亚马逊新方法:用熵移位掩码自蒸馏训练 LLM 评审,超 GRPO 2-9 个点
amazon · hf · 2026-10-02
亚马逊研究团队研究如何从自然语言反馈训练 LLM judge,尤其针对结论高度依赖评判标准和权重的 subjective 任务:
- 主流 outcome-supervised RL(如 GRPO)只按最终判定正确性给整个 rollout 一个标量奖励,不区分「选择标准」的 token,也浪费了偏好标签自带的语言反馈
- 自蒸馏(Self-Distillation)可让模型以反馈为条件充当教师提供密集监督,但并非所有位置信号同等有用
- 团队用师生间逐位置熵移位区分两种模式:context sharpening(教师集中于某特定标准表达,倾向记忆)与 context spreading(概率分散到多个合理标准,促进语义理解),据此对高熵移位位置做掩码,保留低尾
- 实验显示该掩码策略改善分布外泛化;所得 judge 在主观子类上比 outcome-supervised RL 高 2-9 个百分点,客观任务上仍具竞争力
「研究」频道最新
- ARC-Fly 智能体通关 ARC-AGI-3 三款游戏共 11 关,全程自主游玩 — GregKamradt · 2026-10-02
- SciCode/CritPt 式任务可作训练目标:科学推理要可执行可验证 — geoffwolfe · 2026-10-02
- arXiv 单月收稿破 4 万篇,两年翻倍,上线全站限流新政应对 AI 灌水 — qberthet · 2026-10-02
- Pew 数字孪生误差大,直接问前沿模型更准且成本仅千分之一 — paulnovosad · 2026-10-02
- 用 marimo 复刻 Littlewood 分形:Ising 模型采样多项式系数 — S_Conradi · 2026-10-02
- 长上下文的软max分母困境:注意力稀释与两条稀疏化出路 — CShorten30 · 2026-10-02