推理模型训练无需强教师,低概率token更新更关键
burkov · x · 2026-09-02
研究表明,利用强模型打分的训练方式反馈存在噪声,但学生模型仍能提升。核心机制在于训练主要改变了模型自身认为不太可能的 token。基于此提出的 On-Policy Self-Adaptation (OPSA) 方法仅更新低概率 token,并在模型不确定处加强更新,无需教师即可复现大部分收益。
所属事件:研究称同策略蒸馏靠抑制低概率token而非教师(3 条相关)→
「研究」频道最新
- ByteDance 提出计算匹配 MoE 循环 Transformer 缩放定律 — ByteDance-Seed · 2026-09-02
- ZimaBlue: 视频预训练进化出可泛化世界动作模型 — JoyFutureAcademy · 2026-09-02
- H3-World: 复用视频生成器语义实现世界控制 — Danze Chen · 2026-09-02
- Qwen-Drive-1.0: 统一感知与规划的自动驾驶基座 — Qwen · 2026-09-02
- Harness-of-Harness: Agent 迭代开发实现持续改进 — Haoyang Yan · 2026-09-02
- E-Commerce Bench: 长周期电商业务 Agent 评测基准 — Qwen · 2026-09-02