RL-XAR 实测数据:论文与故事人类评测胜率达 89% 和 95%
jaseweston · x · 2026-09-28
Jason Weston 团队 RL-XAR 训练细节:用 Qwen3.5-27B 在三个任务上做 RL(科学论文章节、故事续写、高质量维基百科页面),奖励来自学习到的 rubric,由跨家族的 Qwen3.8-2.4T-A95B 评判,结果再用 GPT5-6 复核。三项任务均有大幅提升,前两项尤其明显。
小规模人类评测中,RL-XAR 在论文和故事上的胜率分别为 89% 和 95%。训练效果上:论文写作主要修复范围过宽和章节焦点问题,故事写作则主要消除陈词滥调。
所属事件:Meta 发布 RL-XAR:专家对齐评分表治 AI slop(4 条相关)→
「研究」频道最新
- Agentick 基准入选 NeurIPS,统一评测 LLM 与 RL 智能体 — pcastr · 2026-09-28
- IROS 2026 共 1933 篇论文,学者精选 130 篇分级阅读清单 — GlenBerseth · 2026-09-28
- 前棋牌 AI 开发者:通用 Agent 正在接管游戏 AI 赛道 — weballergy · 2026-09-28
- Kaggle Game Arena:用象棋扑克狼人杀评测 LLM 防饱和 — weballergy · 2026-09-28
- Penn State 研究:当 AI 当采访者,行为、破绽与信任 — windx0303 · 2026-09-28
- 斯坦福学者 Kundaje:最新 LLM 审稿远胜多年来的垃圾人审 — anshulkundaje · 2026-09-28