Meta 发布 RL-XAR 训练法,宣称破解 AI 写作平庸难题
Meta AI 研究员 Jason Weston 团队发布新方法 RL-XAR(Reinforcement Learning from eXpert-Aligned Rubrics),通过专家对齐的评分表(rubric)提供奖励信号做强化学习,目标是解决大模型输出缺乏高质量写作的 "AI slop" 问题。团队用 Qwen3.5-27B 在科学论文章节、故事续写和高质量维基百科页面三个任务上训练,人类评测中论文与故事的胜率分别达到 89% 和 95%。
2026-09-28 ~ 2026-09-28 · 3 条相关
- Meta 研究 RL-XAR:用专家对齐评分表做 RL,宣称解决 AI slop 写作问题 — jaseweston · 2026-09-28
- RL-XAR 实测数据:论文与故事人类评测胜率达 89% 和 95% — jaseweston · 2026-09-28
另有 1 条近重复转述:jaseweston