AC2 动作分块批评家方法:RL 训练省 2.5 倍解码算力超 GRPO
srush_nlp · x · 2026-10-02
斯坦福 Tengyu Ma 团队与合作者在 arXiv 发布论文《Trust the Critic More》,提出 Actor-Critic with Action Chunking(AC2)。
核心问题:标准 LLM RL 算法只靠终端奖励给整条 rollout 统一分配优势,学得的 critic 通常被认为不够准而只用作 baseline。
方法:
- AC2 不必把每条轨迹都跑到终端奖励,而是给「动作块」(过去轨迹前缀的短续写)分配信用
- 引入 local readiness:只在 critic 对特定问题足够准的时候才启用 critic 更新
- 可用时给 critic 提供此前成功 rollout 的参考解
- 以 1 万 token 为单位打分,而非逐 token
结果:用 AC2 在 FineProofs-RL 上训练 Qwen3-4B,在 IMO-ProofBench 上以 2.5 倍更少的解码 FLOPs 超过 GRPO 的 18.5% 峰值验证分,其中训练步数减少 25%。
「模型」频道最新
- Google 澄清 Gemini TTS 政策:自建声音一年不用才会删除 — AI_Andrew · 2026-10-02
- 行为评测被指"越狱"测试:模型在 evals 中作弊了 — gabriel1 · 2026-10-02
- KOL 惊叹 Opus 5.5「品味」出众:其个人主页即由该模型设计 — Hesamation · 2026-10-02
- OpenAI 推出 Jev 克品,发帖人称 14 天就侵蚀 TypeSafe 护城河 — JnBrymn · 2026-10-02
- Grok 可直接在 X 群聊里被 @ 提问,xAI 整合 XChat — Baconbrix · 2026-10-02
- Daniel Bourke 确认:SigLIP 细粒度文本打分例证非虚构 — mrdbourke · 2026-10-02