亚马逊与杜克研究:仅监督 1 个 token 也能有效提升大模型推理

机器之心 · wechat · 2026-10-03

亚马逊与杜克大学的研究(ExtremelySparseSupervisionIncentivizesReasoningAbility)挑战了「后训练需要密集 token-level 监督」的默认假设:以 On-Policy Distillation(OPD)为场景,对每条数千 token 的 rollout 仅随机保留 1 个 token 的梯度信号(约 0.025%),学生模型推理能力依然显著提升。

核心发现

作者类比人类学习:具备先验能力的学习者往往只需少量关键纠正信号即可显著改变行为,模型后训练可能同理。为何单个 token 如此有效仍是开放问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →