AC2 动作分块新方法省算力且快过 GRPO

斯坦福 Tengyu Ma 团队与合作者在 arXiv 发表论文《Trust the Critic More》,提出 Actor-Critic with Action Chunking(AC2)方法,回应 LLM 强化学习是否必须跑完每条 rollout 的问题。该方法让 Critic 以 token 块为单位评估,只需部分 rollout 即可训练,实测可节省约 2.5 倍解码算力,且效果与速度超过 GRPO。

2026-10-02 ~ 2026-10-03 · 2 条相关