E2S 微调法:把 off-policy 专家数据转成学生模型的 on-policy 样本

Lianhuiq · x · 2026-10-06

研究者 haoqik322 分享周末项目 E2S (Expert-to-Student) Finetuning,一个摊销采样方法,把 off-policy 专家演示转化为更 on-policy 的 SFT 数据,口号是「让 SFT 重新伟大」。

作者的导师 Lianhuiq(冯莲辉)转发了这一工作。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →