AC2 方法用 Critic 评 token 块,部分 rollout 训练快过 GRPO

ZeYanjie · x · 2026-10-03

研究者提出 Actor-Critic with Action Chunking(AC2),回应一个关键问题:LLM 的强化学习是否必须跑完每一条 rollout?

作者 wenkaiyue 转发分享了这一方法,主打「让 critic 变强并信任它」而非暴力跑完所有采样。

所属事件:AC2 动作分块新方法省算力且快过 GRPO(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →