Meta 提出 DCE+SRCL 自蒸馏框架,Qwen3-8B 准确率 30.76% 升至 65.97%

arankomatsuzaki · x · 2026-09-28

Meta 团队在 arXiv 发布论文《Recursive Self-Improvement via On-Policy Distillation for Reasoning》,提出改进 on-policy 自蒸馏(OPSD)的递归框架:

实验显示在 Qwen3-8B 上平均准确率从 30.76% 提升到 65.97%,增益显著。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →