LSD 在线蒸馏法消解 RL 后训练的「长度税」,减少近 23 个百分点

Xu Wan · hf · 2026-10-01

RL 后训练中的长度增长常被视为推理能力提升的标志,但对已解决问题的回复变得冗长且无精度收益。研究者将这一副作用量化为「长度税」(Length-Scaling Tax, LST)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →