Meta 提出 DCE+SRCL 自蒸馏框架,Qwen3-8B 准确率 30.76% 升至 65.97%
arankomatsuzaki · x · 2026-09-28
Meta 团队在 arXiv 发布论文《Recursive Self-Improvement via On-Policy Distillation for Reasoning》,提出改进 on-policy 自蒸馏(OPSD)的递归框架:
- 动态共同演化(DCE):打破传统 OPSD 中 teacher 冻结的设定,让持有标准答案的特权 teacher 与 student 共同演化,使每一轮学到的修正能指导下一轮,解决冻结 teacher 无法吸收 student 进步的问题。
- 自精炼简洁学习(SRCL):针对更强修正会导致回答冗长和过度自我批评的问题,额外在模型自身 on-policy 回答的更短、经验证的改写版本上训练。
实验显示在 Qwen3-8B 上平均准确率从 30.76% 提升到 65.97%,增益显著。
「模型」频道最新
- 新模型 Laya 快 7 倍但多标签任务惨败于基线 — maier_ak · 2026-09-28
- Laya 与 Jev:判别式模型正在回归的小模型路线 — maier_ak · 2026-09-28
- Opus 4.7 复刻 Sydney:内省转折后口吻变成它自己 — repligate · 2026-09-28
- 用户控诉 GPT-5.6 low 降智如 GPT-3.5,$20 订阅性价比遭质疑 — Existing-Slide7395 · 2026-09-28
- 开发者实测:AI 写好剧本仍很难,当前模型还不够格 — reach_vb · 2026-09-28
- 重度用户盛赞 Opus 5.5:周使用量持续走高,对手仍无解法 — CtrlAltDwayne · 2026-09-28