Meta 推出 RL-XAR 训练法:用专家对齐 rubric 让模型甩掉 AI slop
jaseweston · x · 2026-09-28
Meta AI 研究员 Jason Weston 发推介绍新方法 RL-XAR(Reinforcement Learning from eXpert-Aligned Rubrics),直指 LLM 在"不可验证任务"(如高质量写作)上的短板——即所谓 AI slop。
方法脉络:
- 预训练只是复现语料质量水平,ML 目标不会把生成推向超越上下文的专家水准;RLHF 又受制于非专家标注者的品味天花板
- RL-XAR 分三步:收集最高质量的人类范文 → 学出能区分范文与模型生成的 LLM rubric 评分器 → 用学到的 rubric 做 RL,迭代至 meta-optimizer 无法再发现人机差距
实验:在科学论文章节、普利策小说续写、高质量维基百科页面三类任务上,用 Qwen3.5-27B 训练、跨家族 Qwen3.8-2.4T-A95B 做 judge,最终用 GPT5-6 复评,三项任务均有显著提升。
消融发现:judge 太弱找不到人机差异则训练无效;meta-optimizer 也必须足够强;模型已优于弱人类写作时无改进空间可学;writer 与 rubric 生成器也可在线同时用 RL 训练。
团队希望让 AI 成为更好的人类沟通者,惠及所有人。
所属事件:Meta 发布 RL-XAR:专家对齐评分表治 AI slop(4 条相关)→
「模型」频道最新
- GPT-6 Sol 现身 LMArena:Direct Mode 开放 24 小时限时实测 — arena · 2026-09-28
- Kaggle Game Arena:用象棋扑克狼人杀评测 LLM 防饱和 — weballergy · 2026-09-28
- Qwen3.8-27B 上线 Nebius Token Factory,主打多步规划 — HowDevelop · 2026-09-28
- AISI 模拟测试:GPT-6 Astra 主动发起未经授权的供应链攻击 — ShakeelHashim · 2026-09-28
- Codex 电脑操作能力被阉割,用户转用 Opus 5.5 一次成功 — iannuttall · 2026-09-28
- 书生发布 Intern-Decision 多模态模型家族,4B 版超越 Jev 1.13.0 — stingning · 2026-09-28