Apple Proposes DACA-GRPO: Denoising-Aware Credit Assignment for Diffusion LLM RL

Apple ML Research · rss · 2026-09-16

Apple ML Research introduces DACA-GRPO (Denoising-Aware Credit Assignment for GRPO), targeting two fundamental weaknesses of RL for diffusion LLMs:

A method-level advance for RL fine-tuning of diffusion language models.

Original post →

More from Research

Research channel →