亚马逊新方法:用熵移位掩码自蒸馏训练 LLM 评审,超 GRPO 2-9 个点

amazon · hf · 2026-10-02

亚马逊研究团队研究如何从自然语言反馈训练 LLM judge,尤其针对结论高度依赖评判标准和权重的 subjective 任务:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →