发现 PPO critic 价值平坦化失效模式,SP³O 稀疏监督即可修复

Shanghai-AI-Laboratory · hf · 2026-09-17

研究团队揭示了 RL 微调 LLM 中 PPO critic 的一个系统性失效模式——Value Flattening(价值平坦化):基于多条 Monte Carlo 续写估计的真实 state value 在中间状态间剧烈变化,而 critic 的预测却异常平坦。该现象在受控 FrozenLake 环境中也能复现,且状态空间越大越明显。

在 Qwen3-Base 上的实验表明,每条 response 仅监督 3 个状态即可缓解 Value Flattening,并在不同模型规模和评测集上稳定提升策略表现。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →