AC2 方法用 Critic 评 token 块,部分 rollout 训练快过 GRPO
ZeYanjie · x · 2026-10-03
研究者提出 Actor-Critic with Action Chunking(AC2),回应一个关键问题:LLM 的强化学习是否必须跑完每一条 rollout?
- 核心思路:训练一个 learned critic 对 token 块(chunks)打分,并信任其评分,从而只需部分 rollout 即可估计回报
- 效果:相比 GRPO 这类需要完整 rollout 的算法,训练速度更快
- 意义:如果成立,将显著降低 RL 后训练的算力成本,把 RL 训练的经济账往有利方向推动
作者 wenkaiyue 转发分享了这一方法,主打「让 critic 变强并信任它」而非暴力跑完所有采样。
所属事件:AC2 动作分块新方法省算力且快过 GRPO(2 条相关)→
「研究」频道最新
- 斯坦福教授批 AI×生物研究:缺乏对照组、炒作过度 — anshulkundaje · 2026-10-03
- $1000 算力从零训出 nanoswe,SWE-bench 达 15.7% 追平 Claude 3 Opus — sanmikoyejo · 2026-10-03
- AI2 发布 MolmoMotion:3D 点轨迹预测,机器人抓放成功率提升至 76.3% — k7agar · 2026-10-03
- EurekaBench:AI agent 擅长解题,却难以产出真正科学洞见 — scott_linderman · 2026-10-03
- NeurIPS 论文 CaRE-KD:让学生模型学会何时该信任蒸馏教师 — Tanmoy_Chak · 2026-10-03
- OpenTumorBoard:611 例真实肿瘤会诊轨迹基准,14 个 LLM 表现不佳 — Anqi Li · 2026-10-03