Diverging Paths: US Labs Favor RL for LLMs While Chinese Labs Prefer SFT

US AI labs predominantly use reinforcement learning for reasoning tasks, whereas Chinese labs favor supervised fine-tuning on successful trajectories, with proposals to enhance SFT safety via process-level filtering.

2026-07-22 ~ 2026-07-22 · 4 related posts