CriPO:基于自蒸馏的强化学习新方法,算力减半
Mingxuan Xia · hf · 2026-08-03
当前基于评分规则的强化学习在优化大模型时面临探索受限的问题。研究指出,除了未被探索的规则外,还存在一种被压制的规则失败模式——即某些规则虽被满足,但其学习信号在优化过程中丢失。数据显示,超过 57% 的样本存在这种问题。
为此,研究者提出了 CriPO(Criterion-Distilled Policy Optimization)。该方法通过策略自蒸馏同时解决上述两种问题,且不引入训练与推理的不匹配。
实验表明,在医学和科学基准测试中,CriPO 的表现优于现有的强化学习方法,且仅需约一半的优化步数即可达到更强的最终性能。
「研究」频道最新
- 陶哲轩 ICM 演讲:探讨 AI 时代的数学研究 — alejandroll10 · 2026-08-03
- 阿里 GALA 框架:用强化学习对齐多模态特征提升推荐精度 — _reachsumit · 2026-08-03
- 快手 RecHarness:用 LLM 自动迭代推荐系统架构 — _reachsumit · 2026-08-03
- HyPE 新方法:将 RAG 检索转化为问题匹配,精度提升 42% — _reachsumit · 2026-08-03
- 开源工具 Pose2Sim:普通摄像头实现 3D 无标记动作捕捉 — tom_doerr · 2026-08-03
- 别盲信跑分:专家警告大模型评测工具差异会严重扭曲成绩 — cedric_chee · 2026-08-03