无需监督信号,新自蒸馏方法让 LLM 自我纠错能力提升
burny_tech · x · 2026-08-08
传统的大语言模型自蒸馏方法往往仍需依赖标准答案、验证器奖励或更强的教师模型。一篇名为《On-Policy Self-Distillation without Any Supervision》的论文提出了一种完全自监督的新方法。
其核心机制为:
- 对同一问题采样多个解答
- 通过多数投票生成伪答案
- 将基于伪解的条件分布蒸馏到那些与伪答案不一致的生成结果中
这种方法无需任何标签即可提供密集的策略内修正。实验表明,在 Qwen3 数学任务的非思考模式下,该方法相比有监督的 OPSD 和 GRPO 分别提升了 3.2 和 8.9 个百分点。
所属事件:字节等提出大模型自我纠错新自蒸馏方法(2 条相关)→
「研究」频道最新
- Anthropic 研究员:AI 时代做科研该选的三类问题 — CatAstro_Piyush · 2026-09-23
- EA Explorer 公共数据快照开放下载:6.6GB 含 13 万条评论记录 — AaronBergman18 · 2026-09-23
- GAE提出几何原生潜空间:FVD降23%,相机误差减半 — yshan2u · 2026-09-23
- MedRSI 论文:自改进医疗 Agent 需慢注册机制守住 94.4% 准确率 — rohanpaul_ai · 2026-09-23
- eidon-ai 发布 tracker-pov 机器人视频数据集,规模 1 万至 10 万条 — eidon-ai · 2026-09-23
- AIDE^2 让 AI 研究 agent 递归自我改进,8 天迭代 7 次 — WecoAI · 2026-09-23