新方法 AC2 只需部分 rollout 胜过 GRPO,LLM 强化学习再提速

stanfordnlp · x · 2026-10-06

斯坦福研究者 wenkaiyue 等提出 Actor-Critic with Action Chunking(AC2),挑战「GRPO 式 RL 无法最优」的直觉,目标是让 self-play 与 RSI 投入的数十亿美元算力用得更高效。

核心思路:

作者称 AC2 训练速度可超过 GRPO。项目获 tengyuma 等研究者转发推荐。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →