AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力超 GRPO

srush_nlp · x · 2026-10-02

斯坦福 Tengyu Ma 团队与合作者在 arXiv 发布论文《Trust the Critic More》,提出 Actor-Critic with Action Chunking(AC2)。

核心问题:标准 LLM RL 算法只靠终端奖励给整条 rollout 统一分配优势,学得的 critic 通常被认为不够准而只用作 baseline。

方法:

结果:用 AC2 在 FineProofs-RL 上训练 Qwen3-4B,在 IMO-ProofBench 上以 2.5 倍更少的解码 FLOPs 超过 GRPO 的 18.5% 峰值验证分,其中训练步数减少 25%。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →