DAPD 方法破解大模型策略蒸馏的特权幻觉

新论文 DAPD(双重锚定策略蒸馏)针对大模型训练后阶段的同策略蒸馏问题提出了解决方案。研究指出,传统方法会导致“特权幻觉”,即学生模型在训练时依赖特权信息,推理时却无法获取,从而产生信息不对称。DAPD 方法有效破解了这一缺陷,显著提升了模型的推理性能。

2026-08-04 ~ 2026-08-05 · 2 条相关