发现 PPO critic 价值平坦化失效模式,SP³O 稀疏监督即可修复
Shanghai-AI-Laboratory · hf · 2026-09-17
研究团队揭示了 RL 微调 LLM 中 PPO critic 的一个系统性失效模式——Value Flattening(价值平坦化):基于多条 Monte Carlo 续写估计的真实 state value 在中间状态间剧烈变化,而 critic 的预测却异常平坦。该现象在受控 FrozenLake 环境中也能复现,且状态空间越大越明显。
- 归因:理论上联系到 critic loss 中的隐式方差惩罚,以及时间相关状态梯度相似导致的冗余更新
- 解决方案 SP³O(SParse PPO):每条 response 只对少数间隔良好的状态施加 value loss,同时缓解两类效应
在 Qwen3-Base 上的实验表明,每条 response 仅监督 3 个状态即可缓解 Value Flattening,并在不同模型规模和评测集上稳定提升策略表现。
「研究」频道最新
- Cisco 3B 模型漏洞定位得分 0.223,修复后仍误报远少于 GPT-5.5 — shashib · 2026-09-17
- 自动驾驶世界模型新进展:并行解码蒸馏提升生成效率 — abursuc · 2026-09-17
- NVIDIA SpatialClaw:代码即接口,20 项空间基准超此前 agent 11.2 分 — CMHungSteven · 2026-09-17
- 世界模型互动难题:状态需承载多种频率的信息流 — abursuc · 2026-09-17
- 研究者指 AI 数学评测长期依赖虚假基线,数学界缺乏实证传统 — RexDouglass · 2026-09-17
- CoLLAs 2026 主题演讲:持续学习是否困于过时抽象? — apsarathchandar · 2026-09-17