研究:用更小模型生成 rejected 样本,7B-72B 学生模型训练效果反而更强

LinkedIn · hf · 2026-10-02

LinkedIn 研究挑战偏好蒸馏的两个默认假设:自生成失败是最有信息量的负样本、rejected 样本必须来自不小于学生的模型。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →