Meta 发布 RL-XAR 训练法,宣称破解 AI 写作平庸难题

Meta AI 研究员 Jason Weston 团队发布新方法 RL-XAR(Reinforcement Learning from eXpert-Aligned Rubrics),通过专家对齐的评分表(rubric)提供奖励信号做强化学习,目标是解决大模型输出缺乏高质量写作的 "AI slop" 问题。团队用 Qwen3.5-27B 在科学论文章节、故事续写和高质量维基百科页面三个任务上训练,人类评测中论文与故事的胜率分别达到 89% 和 95%。

2026-09-28 ~ 2026-09-28 · 3 条相关

另有 1 条近重复转述:jaseweston