破解策略蒸馏的特权幻觉,DAPD 显著提升模型性能
Shanghai-AI-Laboratory · hf · 2026-08-04
在语言模型的训练后阶段,同策略蒸馏被广泛使用。然而,这种方法会导致“特权幻觉”:学生模型学到了依赖训练时特权信息的行为,但在推理时却无法获取这些信息,从而表现为好像仍能获取特权信息,最终导致性能下降。
上海 AI 实验室的研究者指出,特权教师模型与学生模型在推理时的信息不对称是这一问题的根源。为此,他们提出了 DAPD(双锚定策略蒸馏) 框架:
- 双路径锚定 (DPA):引入自条件桥,沿两条匹配信息路径对齐参考与 rollout 行为,防止特权行为转移给推理时的学生模型。
- 双源锚定 (DSA):在参考到 rollout 和 rollout 到参考的双向路径中应用,减少对特权参考指导的依赖,同时保持正确的监督。
实验表明,DAPD 在多项任务中平均比 OPSD 提升 2.00 分,且这种增益在不同模型规模(4B 到 32B)中持续存在。
「研究」频道最新
- NeurIPS录用率受限内幕:场地不够,多推的论文只能拒 — qberthet · 2026-08-04
- 别让AI编码助手重复造轮子:RL环境应预装标准库 — cephaloform · 2026-08-04
- 深朴智能发布HiFi-UMI:无本体数据保真度大幅提升,后训练直达真机 — 机器之心 · 2026-08-04
- 千寻智能研究:机器人硬件升级后,老数据存在“开窍时刻” — 机器之心 · 2026-08-04
- QuerySplat: 解耦几何与外观的 3DGS 预测新框架 — zhenjun_zhao · 2026-08-04
- UniSim-SLAM: 统一 Sim(3) 优化的前馈 SLAM 系统 — zhenjun_zhao · 2026-08-04