Apple 提出 DACA-GRPO:为扩散语言模型强化学习做去噪感知的信用分配

Apple ML Research · rss · 2026-09-16

Apple ML Research 发布 DACA-GRPO(Denoising-Aware Credit Assignment for GRPO),针对扩散大语言模型(dLLM)强化学习的两个根本缺陷:

这是扩散语言模型训练方法层面的进展,对 dLLM 的 RL 微调研究有直接参考价值。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →