On-Policy 自蒸馏的批判性综述:一个症状,三个杠杆
OVHaiLLM · hf · 2026-09-08
一项新研究对用于数学推理的 on-policy 自蒸馏(self-distillation)方法进行批判性审视。
- 该方法利用特权信息(privileged information)引导模型,无需更大的教师模型
- 但存在推理坍塌(reasoning collapse)问题
- 论文指出坍塌由三个因素支配:token 加权方式、特权上下文、引导动态(guidance dynamics),即「一个症状,三个杠杆」
「研究」频道最新
- Terry Tao 撰文评 Buckmaster 团队构造流体方程爆破解 — LucaAmb · 2026-09-08
- ECCV 2026 将办交互式社交 Avatar 研讨会,Zisserman 等主讲 — JonathonLuiten · 2026-09-08
- 给黑盒 LLM 建主动监控:自动化边界该画在哪? — Particular-Roof4257 · 2026-09-08
- NYU 数学家称用 LLM 月内攻克流体爆破难题,指控 OpenAI 抢发除名 — dotey · 2026-09-08
- EmbodiedSkills:统一编排、训练与部署 VLA 机器人技能的框架 — Wei Wang · 2026-09-08
- 流体正则性问题进展神速:Tao 称光滑解证明或已可行 — basedjensen · 2026-09-08