RL-XAR 实测数据:论文与故事人类评测胜率达 89% 和 95%

jaseweston · x · 2026-09-28

Jason Weston 团队 RL-XAR 训练细节:用 Qwen3.5-27B 在三个任务上做 RL(科学论文章节、故事续写、高质量维基百科页面),奖励来自学习到的 rubric,由跨家族的 Qwen3.8-2.4T-A95B 评判,结果再用 GPT5-6 复核。三项任务均有大幅提升,前两项尤其明显。

小规模人类评测中,RL-XAR 在论文和故事上的胜率分别为 89% 和 95%。训练效果上:论文写作主要修复范围过宽和章节焦点问题,故事写作则主要消除陈词滥调。

所属事件:Meta 发布 RL-XAR:专家对齐评分表治 AI slop(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →