新方法 AC2 只需部分 rollout 胜过 GRPO,LLM 强化学习再提速
stanfordnlp · x · 2026-10-06
斯坦福研究者 wenkaiyue 等提出 Actor-Critic with Action Chunking(AC2),挑战「GRPO 式 RL 无法最优」的直觉,目标是让 self-play 与 RSI 投入的数十亿美元算力用得更高效。
核心思路:
- 用 critic 监督 policy:训练一个学习型 critic 给 token 块(chunks)打分,信任 critic 后就不必跑完每条 rollout
- 只需部分 rollout:按块打分提前截断采样,大幅减少无效生成
- Q 与 policy 共享参数,并利用 LLM 易于 reset 的特性
作者称 AC2 训练速度可超过 GRPO。项目获 tengyuma 等研究者转发推荐。
「研究」频道最新
- tszzl:对齐要成为工程学科,起码得先攻克机制可解释性 — tszzl · 2026-10-06
- 因果决策研究亮相可信 AI 研讨会,录像已公开 — murat_kocaoglu_ · 2026-10-06
- Claude 突破 3SUM 复杂度下界,给出 O(n^1.9992) 算法附 Lean 证明 — thegautamkamath · 2026-10-06
- ReSteer 开源:修复 VLA 执行中途无视新指令的可控性缺陷 — siddkaramcheti · 2026-10-06
- 研究者携「推理模型潜空间策略状态」解读工作参加 COLM — hunarbatra · 2026-10-06
- COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态 — hunarbatra · 2026-10-06