Diverging Paths: US Labs Favor RL for LLMs While Chinese Labs Prefer SFT
US AI labs predominantly use reinforcement learning for reasoning tasks, whereas Chinese labs favor supervised fine-tuning on successful trajectories, with proposals to enhance SFT safety via process-level filtering.
2026-07-22 ~ 2026-07-22 · 4 related posts
- U.S. labs lean on RL while Chinese labs favor SFT on successful traces — goyalshaliniuk · 2026-07-22
- US Labs Prefer RL for Reasoning, Chinese Labs Lean Towards SFT on Traces — xuanalogue · 2026-07-22
- Filtering Reasoning Traces for Alignment Before SFT to Avoid RL Pathologies — xuanalogue · 2026-07-22
- Process-level safety filtering before SFT could train aligned reasoning models — xuanalogue · 2026-07-22