Meta 推出 RL-XAR 训练法:用专家对齐 rubric 让模型甩掉 AI slop

jaseweston · x · 2026-09-28

Meta AI 研究员 Jason Weston 发推介绍新方法 RL-XAR(Reinforcement Learning from eXpert-Aligned Rubrics),直指 LLM 在"不可验证任务"(如高质量写作)上的短板——即所谓 AI slop。

方法脉络:

实验:在科学论文章节、普利策小说续写、高质量维基百科页面三类任务上,用 Qwen3.5-27B 训练、跨家族 Qwen3.8-2.4T-A95B 做 judge,最终用 GPT5-6 复评,三项任务均有显著提升。

消融发现:judge 太弱找不到人机差异则训练无效;meta-optimizer 也必须足够强;模型已优于弱人类写作时无改进空间可学;writer 与 rubric 生成器也可在线同时用 RL 训练。

团队希望让 AI 成为更好的人类沟通者,惠及所有人。

所属事件:Meta 发布 RL-XAR:专家对齐评分表治 AI slop(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →