无需监督信号,新自蒸馏方法让 LLM 自我纠错能力提升
burny_tech · x · 2026-08-08
传统的大语言模型自蒸馏方法往往仍需依赖标准答案、验证器奖励或更强的教师模型。一篇名为《On-Policy Self-Distillation without Any Supervision》的论文提出了一种完全自监督的新方法。
其核心机制为:
- 对同一问题采样多个解答
- 通过多数投票生成伪答案
- 将基于伪解的条件分布蒸馏到那些与伪答案不一致的生成结果中
这种方法无需任何标签即可提供密集的策略内修正。实验表明,在 Qwen3 数学任务的非思考模式下,该方法相比有监督的 OPSD 和 GRPO 分别提升了 3.2 和 8.9 个百分点。
「研究」频道最新
- FactorJEPA:针对拥挤城市环境的世界模型与数据集 — Kapil Wanaskar · 2026-08-08
- 数据价值的本质:取决于验证与生成的未来成本下限 — oyhsu · 2026-08-08
- 港大赵恒爽入选 MIT TR35 中国,深耕具身智能与三维视觉 — YiMaTweets · 2026-08-08
- Genomic Intelligence 办研讨会:演示 DNA 模型与智能体集成 — julia_kiseleva · 2026-08-08
- 研究:AI生成补丁成功率仅约50%,且可能引入新漏洞 — WeldPond · 2026-08-08
- 为物理世界而生:新多模态架构突破推理速度瓶颈 — AkshatS07 · 2026-08-08