Apple 提出 DACA-GRPO:为扩散语言模型强化学习做去噪感知的信用分配
Apple ML Research · rss · 2026-09-16
Apple ML Research 发布 DACA-GRPO(Denoising-Aware Credit Assignment for GRPO),针对扩散大语言模型(dLLM)强化学习的两个根本缺陷:
- 现有 RL 方法的问题:将所有去噪步骤视为同等重要,缺乏跨去噪轨迹的时间信用分配;且用于策略优化的 mean-field 似然估计存在系统性偏差、方差高
- 方案:DACA-GRPO 是对任意 GRPO 风格训练器即插即用的轻量增强,实现去噪感知的信用分配,降低似然估计偏差
这是扩散语言模型训练方法层面的进展,对 dLLM 的 RL 微调研究有直接参考价值。
「研究」频道最新
- Tobias Lee 谈训练方向:可验证任务用 RL,开放领域靠 MOPD — _AndrewZhao · 2026-09-17
- Schmidhuber 发长文:递归自我改进研究可追溯到 1987 年 — rbhar90 · 2026-09-17
- LocalFold 将 AlphaFold3 等多款蛋白折叠模型搬进浏览器本地推理 — sokrypton · 2026-09-17
- ColabFold2 预览版整合 AlphaFold3 等 10 个蛋白质预测工具,全部基于 JAX — sokrypton · 2026-09-17
- 临床医生吐槽:AI 横扫数学却几乎没碰临床试验 — LaCaipirinha · 2026-09-17
- ColabFold 1.6.3 发布:速度提升 2.5 倍,新增 ipSAE+pDockQ2 评分 — sokrypton · 2026-09-17