微软新研究:弱模型相减提取能力,8B 学生模型反超专家
theomitsa · x · 2026-08-02
微软近期发表的一篇新论文提出了一种全新的后训练与蒸馏思路,旨在解决当前前沿学生模型缺乏更大教师模型可借鉴的瓶颈。
核心方法是不再依赖庞大的教师模型,而是取两个较小的弱模型(例如 4B 的 RL 模型与其未经 RL 的基础模型),通过计算它们 logits 的差值,来精准分离出需要增强的“能力方向”。
将这一信号反馈给 8B 的学生模型后,该模型在数学和代码任务上的表现,最终超越了原本指导它的领域专家模型。这种做法以极低的算力成本成功激发了模型的潜在能力,对从事蒸馏与强化学习的研究者很有启发。
「研究」频道最新
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24