Masked diffusion 语言模型提升 agentic RL 世界模型
PatronusAI · hf · 2026-07-22
Masked diffusion 文本世界模型,让 agentic RL 更可控
这篇论文讨论的是:随着强化学习和 agent 训练继续推进,手工设计的固定难度环境越来越不够用,模型需要更丰富、可按需变化的训练世界模型。作者把文本世界建模重写为一个可控的状态转移问题,显式考虑初始状态、任务上下文、工具 schema、领域规则和 steering 指令。
主要内容
- 构建了一个包含 239,403 条 grounded state-action trajectories 的数据集,覆盖 9 个开源环境和 12 组前沿模型家族。
- 对比了 autoregressive 世界模型与 masked diffusion language models(MDLMs)。
- 提出一个可直接插入的 GRPO 训练框架,并加入确定性状态检查。
结论
- MDLMs 在一致性、groundedness 和rollout 多样性上优于 AR 模型,即使对方参数规模超过 4 倍,推理延迟也相近。
- 在 ScienceWorld、ALFWorld、AppWorld 上做零样本迁移时,方法相对基线最高带来 47% 绝对提升,且不需要针对具体环境微调。
- 作者还分析了对抗场景下的失败模式,并做人类评估,考察 realism、outcome correctness 和 training utility。
这篇工作更偏“agent 训练基础设施 + 世界模型”方向,且已开源。
「研究」频道最新
- 开源 VRChat 高斯溅射新版本:支持亿级渲染 — Michael_Moroz_ · 2026-07-22
- AI 发展的瓶颈:从互联网数据红利到高质量反馈闭环 — dyamins · 2026-07-22
- NVIDIA 公布 22 篇 SIGGRAPH 论文与机器人仿真工具 — facontidavide · 2026-07-22
- Nat Lambert 分享合成数据与智能体 SFT 阅读清单 — natolambert · 2026-07-22
- Lightwheel AI 推出 SimReadyGen:文本生成物理级机器人仿真资产 — ZeYanjie · 2026-07-22
- PNAS 专题讨论版权、治理与 AI 法律系统 — chrmanning · 2026-07-22