AC2 动作分块新方法省算力且快过 GRPO
斯坦福 Tengyu Ma 团队与合作者在 arXiv 发表论文《Trust the Critic More》,提出 Actor-Critic with Action Chunking(AC2)方法,回应 LLM 强化学习是否必须跑完每条 rollout 的问题。该方法让 Critic 以 token 块为单位评估,只需部分 rollout 即可训练,实测可节省约 2.5 倍解码算力,且效果与速度超过 GRPO。
2026-10-02 ~ 2026-10-03 · 2 条相关
- AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力超 GRPO — srush_nlp · 2026-10-02
- AC2 方法用 Critic 评 token 块,部分 rollout 训练快过 GRPO — ZeYanjie · 2026-10-03