Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师
natolambert · x · 2026-07-21
Nat Lambert 反驳了一种说法:中文实验室在 RL 蒸馏时会拿最强模型当 teacher。
- 他认为这不是蒸馏的实际工作方式。
- 在 RL 里把最强模型直接拿来当 teacher,提升不会有那么大,因为 RL 的 grader 本身就很脏、很难处理,而且成本也承受不起。
- 这条讨论的核心是训练流程与蒸馏机制,而不是简单的模型能力八卦。
「研究」频道最新
- Sakana AI 推出 Fugu-Cyber,称安全跑分只是开始 — SakanaAILabs · 2026-07-22
- Meta 用 SAM 3 和 DINOv3 将 3D 标注缩短到 15 分钟 — AIatMeta · 2026-07-22
- Project CETI 登上 Jeopardy!,题面玩起 SETI 式鲸类梗 — begusgasper · 2026-07-22
- 研究发现记忆压缩会让智能体丢掉安全规则,违规率高达 59% — gerardsans · 2026-07-22
- DriftWorld 宣称世界模型可跑 30+ FPS 且仅需 1–2 张 GPU — du_yilun · 2026-07-22
- 物理奖励能改进视频生成,但不等于物理引擎 — Dapper-Drawer4546 · 2026-07-22