Meta 研究 RL-XAR:用专家对齐评分表做 RL,宣称解决 AI slop 写作问题
jaseweston · x · 2026-09-28
Meta AI 研究员 Jason Weston 团队发布新方法 RL-XAR(RL with eXpert-Aligned Rubrics),目标解决 LLM 输出缺乏高质量写作的「AI slop」问题。
- 核心思路:预训练只会复述上下文质量,RLHF 的奖励又受制于非专家标注员的天花板,因此先收集顶级人类写作样本,学习能区分专家文本与模型生成的评分表(rubrics),再用这些 rubrics 做强化学习,并迭代优化 rubrics 直到专家与模型的差距无法辨别。
- 任务覆盖:撰写科学论文章节、普利策奖小说续写、高质量维基百科页面,多项指标显示较标准训练大幅提升。
- 详细结果见后续推文(跨家族 Qwen3.8-2.4T-A95B 评分、GPT5-6 复核、人类评测胜率等)。
所属事件:Meta 发布 RL-XAR 训练法,宣称破解 AI 写作平庸难题(3 条相关)→
「研究」频道最新
- SmolDataEnvs 发布:5k+ 可验证 RL 任务,用真实 Kaggle 数据训练小模型 — SergioPaniego · 2026-09-28
- 线性模式连通性:测试损失上出现、训练损失上却没有的被低估现象 — _arohan_ · 2026-09-28
- John Langford 发布 Vowpal Wabbit 9.11.9 修复版,自动打通多平台包发布 — JohnCLangford · 2026-09-28
- 实验室 NeurIPS 发三篇论文:CoT 忠实度指标近乎失效 — megamor2 · 2026-09-28
- CodeGraph:用代码 LLM 为 1.67 亿源码文件构建开放分类知识图谱 — Federico Pennino · 2026-09-28
- Adobe 提出输出头 Softmax 重参数化,W4 量化后 KL 误差降 73% — adobe · 2026-09-28