解析长任务训练崩溃:自蒸馏为何优于GRPO与RLHF
AI Engineer · youtube · 2026-08-12
在这场技术演讲中,Ronak Malde 深入探讨了持续学习在规模化长任务(如包含上百次工具调用的轨迹)中面临的挑战。他指出,传统的策略自蒸馏会导致模型陷入过度对冲,倾向于使用“wait”、“but”等词汇,最终使输出变成毫无意义的“maybe”。
Malde 提出了一种自蒸馏算法:在前沿模型缺乏更优秀教师的情况下,让模型自我教学。具体做法是在教师提示中注入特权信息(提示),并让未看到提示的学生模型匹配其对数概率。这种方法满足了在线任务分布、策略采样等四大核心属性,且能对全词表进行优化,表现优于 GRPO 和 RLHF。演讲还剖析了提示泄漏(类似奖励黑客)等失败模式及其解决思路。
「研究」频道最新
- 图解 AI 数学能力进展:解决 Erdős 问题成本逼近千万美元 — ajeya_cotra · 2026-08-12
- ApexFold:根据化学环境预测多肽二级结构 — KevinKaichuang · 2026-08-12
- 研究揭示人类与猕猴视觉皮层共享高维物体空间 — martin_hebart · 2026-08-12
- Physical Intelligence 联创:机器人正进入 GPT 时代 — Y Combinator · 2026-08-12
- Engram深度解析:为何私有数据上的大模型训练会崩溃 — AI Engineer · 2026-08-12
- 实测 Gemma 4 QAT:KV Cache 量化表现大幅提升 — Anbeeld · 2026-08-12