E2S 微调法:把 off-policy 专家数据转成学生模型的 on-policy 样本
Lianhuiq · x · 2026-10-06
研究者 haoqik322 分享周末项目 E2S (Expert-to-Student) Finetuning,一个摊销采样方法,把 off-policy 专家演示转化为更 on-policy 的 SFT 数据,口号是「让 SFT 重新伟大」。
- 问题:普通 SFT 让学生模型模仿正确但 off-policy 的专家轨迹,导致不必要的策略偏移和遗忘。
- 思路:训练模型「用学生自己的语言复述专家数据」。形式化为受限生成问题——专家定义约束(哪些特权信息须保留),学生在约束下生成更 on-policy 的回复。
- 与已有工作的关系:近期 Finetuning with Sampling 论文用逐样本 MCMC 命中该分布,但每个样本推理时搜索代价高;E2S 将搜索摊销,训练一个跨样本的条件采样器。
作者的导师 Lianhuiq(冯莲辉)转发了这一工作。
「研究」频道最新
- HAIPS@COLM 2026 工作坊聚焦语言模型的人本隐私与安全 — tianshi_li · 2026-10-07
- CUAWright 论文:只用终端命令,computer-use agent 胜过 GUI 方案 — ysu_nlp · 2026-10-07
- AI 年度十佳论文揭晓:Rulin Shao 一人独占两篇,皆为一作 — ShayneRedford · 2026-10-07
- Paradigm 发布数学推理模型:7 项高难基准评测套件全开源 — tensorqt · 2026-10-07
- Paradigm 揭秘后训练关键:程序生成+LLM 出题的互补合成数据组合 — tensorqt · 2026-10-07
- Paradigm RL 训练细节:用价值模型解决 credit assignment,上下文扩至 131k — tensorqt · 2026-10-07