LSD 在线蒸馏法消解 RL 后训练的「长度税」,减少近 23 个百分点
Xu Wan · hf · 2026-10-01
RL 后训练中的长度增长常被视为推理能力提升的标志,但对已解决问题的回复变得冗长且无精度收益。研究者将这一副作用量化为「长度税」(Length-Scaling Tax, LST)。
- 提出 Length Self-Distillation (LSD):把已解决的 prompt 路由到 on-policy 蒸馏,未解决的保留原 RL 目标
- 教师模型用在线策略的指数移动平均,无需外部模型
- 单轮推理 LST 从 19.0% 降至 -3.7%,多轮 agentic 任务从 31.4% 降至 13.7%
- LSD 在多个变体上达到与 RL 相当或更好的性能,同时抑制简单查询上的回复长度增长
「研究」频道最新
- 原版邓宁-克鲁格论文被批实验设计糟糕 — dbasch · 2026-10-01
- 普林斯顿教授:AI 安全长期被轻视,三大科学问题待解 — HazanPrinceton · 2026-10-01
- DevDataLab 发布全球万城开放数据平台,要做城市版 Penn World Table — paulnovosad · 2026-10-01
- SWE-sweep 基准发布:顶尖模型无监督找 bug 成功率不足 5% — OfirPress · 2026-10-01
- EDVAC 报告内部分发如何造就「冯·诺依曼架构」之名 — burny_tech · 2026-10-01
- 学者质疑 RNA 模型微调后改名:古典 fine-tuning 不该换名字发表 — anshulkundaje · 2026-10-01