Progressive Point Matching: Dense Per-Token Credit for Long-Horizon LLM RL, Beating GRPO Exponentially

kvfrans · x · 2026-09-09

Original post →

More from Research

Research channel →