CriPO:基于自蒸馏的强化学习新方法,算力减半

Mingxuan Xia · hf · 2026-08-03

当前基于评分规则的强化学习在优化大模型时面临探索受限的问题。研究指出,除了未被探索的规则外,还存在一种被压制的规则失败模式——即某些规则虽被满足,但其学习信号在优化过程中丢失。数据显示,超过 57% 的样本存在这种问题。

为此,研究者提出了 CriPO(Criterion-Distilled Policy Optimization)。该方法通过策略自蒸馏同时解决上述两种问题,且不引入训练与推理的不匹配。

实验表明,在医学和科学基准测试中,CriPO 的表现优于现有的强化学习方法,且仅需约一半的优化步数即可达到更强的最终性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →