无需标签与教师模型,u-OPSD 自蒸馏法大幅提升 LLM 数学推理

burny_tech · x · 2026-08-12

u-OPSD 是一种新型的语言模型自蒸馏方法。该方法无需任何外部标签、验证器或教师模型,仅通过让模型对自身的多次生成结果进行多数投票,并针对存在分歧的部分进行蒸馏学习,即可实现自我能力提升。

实验表明,在数学推理任务上,该方法优于传统的监督式 OPSD 和 GRPO 方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →