AVSD 被 NeurIPS 2026 接收:多视角特权信息自适应蒸馏改进 LLM 推理 RL

mohitban47 · x · 2026-09-30

AVSD(Adaptive-View Self-Distillation)被 NeurIPS 2026 接收,研究如何为 LLM 推理的 on-policy RL 提供更好的 token 级学习信号。背景是稀疏二元奖励是 LLM RL 的瓶颈,自蒸馏可利用特权信息构造稠密 teacher,但现有方法通常只用单一特权视角(完整解、部分理由、仅答案、参考代码等),存在两个问题:没有任何单一视角始终最优;视角会引入学生不可得信息带来的 teacher 伪影。

AVSD 的核心想法:有用的监督既来自多个 teacher 的共识信息,也来自各视角独有信息——hint、部分/完整解、执行输出等多视角各自诱导不同的 teacher 分布,方法自适应地融合两者,为数学和代码推理产生更好的 token 级学习信号。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →