美团开源 SAKI:耦合路由监督让小模型蒸馏提速 4.22 倍
meituan · hf · 2026-09-30
美团发布 SAKI(Supervision Allocation with KL-constrained Interpolation),针对 on-policy 蒸馏(OPD)的核心痛点:弱学生模型会走到与教师不对齐的前缀上,导致监督信号失真。
核心做法:
- 用 KL 约束的教师引导 rollout 结合 maximal coupling,把教师「接受/纠正」事件复用来做 token 级监督路由:被接受的位置保留采样 token 的反向 KL 监督,被纠正的位置直接用教师最高概率 token 做监督。
- 在 maximal coupling 下,纠正概率恰好等于 TV(pt, qt),因此同一个信赖域半径同时控制 rollout 偏离并上界干预频率。
- 实现引擎内驻留的投机式验证器,在保持精确 q 分布与耦合语义的同时,把匹配负载的 rollout 吞吐提升 4.22 倍。
在 7 个数学推理基准上,1.7B 和 0.6B 学生模型的 Mean@8 与 Pass@8 均超过匹配的教师引导基线;放置控制实验与固定前缀分析也支持「纠正触发路由」作为冲突自适应的监督信号。
「研究」频道最新
- Hugging Face 发布 tokenizers v1:性能较 v0.23 提升数十倍 — ariG23498 · 2026-09-30
- EMNLP 口头报告:RL 教模型更高效遍历参数化知识 — niloofar_mire · 2026-09-30
- Midas Touch 代码数据集遭质询:可复现性与数据泄漏存疑 — maier_ak · 2026-09-30
- Midas Touch:直接从源码扩展 AI 编码环境的新论文 — maier_ak · 2026-09-30
- 预训练算力超 1e22 FLOPs 后可直接砍掉视觉编码器 — heghbalz · 2026-09-30
- 研究者预言神经网络或可分解为演化式符号系统 — QuintinPope5 · 2026-09-30