无需标签与教师模型,u-OPSD 自蒸馏法大幅提升 LLM 数学推理
burny_tech · x · 2026-08-12
u-OPSD 是一种新型的语言模型自蒸馏方法。该方法无需任何外部标签、验证器或教师模型,仅通过让模型对自身的多次生成结果进行多数投票,并针对存在分歧的部分进行蒸馏学习,即可实现自我能力提升。
实验表明,在数学推理任务上,该方法优于传统的监督式 OPSD 和 GRPO 方法。
「研究」频道最新
- 实测 Gemma 4 QAT:KV Cache 量化表现大幅提升 — Anbeeld · 2026-08-12
- 推荐:303页代码模型与智能体工程实战综述 — mdancho84 · 2026-08-12
- 多智能体辩论:配置得当可显著减少幻觉 — mdancho84 · 2026-08-12
- 代码模型天生不安全,MoE 微调比 Dense 模型更脆弱 — mdancho84 · 2026-08-12
- 编程缩放定律不统一,Python 因动态类型致负迁移 — mdancho84 · 2026-08-12
- 50位学者303页综述:RLVR让小模型逆袭编程 — mdancho84 · 2026-08-12