亚马逊与杜克研究:仅监督 1 个 token 也能有效提升大模型推理
机器之心 · wechat · 2026-10-03
亚马逊与杜克大学的研究(ExtremelySparseSupervisionIncentivizesReasoningAbility)挑战了「后训练需要密集 token-level 监督」的默认假设:以 On-Policy Distillation(OPD)为场景,对每条数千 token 的 rollout 仅随机保留 1 个 token 的梯度信号(约 0.025%),学生模型推理能力依然显著提升。
核心发现
- 基于 Qwen3 构造 9 组不同规模的教师—学生配置,所有组合中单 token 监督均带来推理性能提升;跨代码推理任务、Llama 系列、PPO/RLVR 范式同样成立。
- 若改为保留每条 rollout 中师生分歧最大的 token,仅 1-2 个 token 的监督即可匹配甚至超过全信号训练;部分设置下学生模型甚至超过教师本身。
- 性能与监督稠密度并非单调关系:随监督减少性能先降后升,极端稀疏时可超越全信号,但进一步稀疏后学习信号不足。
- 有趣现象:性能最强的学生与教师的输出分布差异不降反升,说明学生并非靠模仿教师获得提升;万分之一的监督信号仅更新约 10% 网络参数即可大幅提升推理性能。
- 学生表征能力强于教师时,带正奖励的 token 更有效;反之带负奖励的 token 更好。
作者类比人类学习:具备先验能力的学习者往往只需少量关键纠正信号即可显著改变行为,模型后训练可能同理。为何单个 token 如此有效仍是开放问题。
「研究」频道最新
- 博主熬夜发布强化学习博客,CUDA 系列下篇下周五更新 — goyal__pramod · 2026-10-03
- AgentBug-Smith 论文:顶级编码智能体仅能修复 9% 的智能体框架 Bug — rohanpaul_ai · 2026-10-03
- CoRL 2026 将办 Sim2Real2Field 研讨会,聚焦从仿真到实地部署 — berkeley_ai · 2026-10-03
- HPE Labs 光子 AI 加速器综述:波长与时域 GEMM 配 QD comb 激光器 — jwt0625 · 2026-10-03
- Hinton 自称「AI 教父」却说:我们并不真正理解神经网络如何工作 — austinc3301 · 2026-10-03
- 从零可视化推导 LLM 策略梯度:一道 17×24 讲透 REINFORCE — joecole · 2026-10-03