训练者激辩模型蒸馏:小模型学不动前沿推理痕迹,27B 才是甜点位

JoshPurtell · x · 2026-09-03

X 上一场关于「大厂是否蒸馏了其他模型」的争论中,JoshPurtell 拆解了两种蒸馏定义:1) 越狱 API 抓取原始思维链(CoT)直接照抄——风险极高,账号一旦被发现大概率被封;2) 让大模型在开发环境里执行任务,再用其工具调用/非推理输出做训练——难以追踪,风险低得多。

核心论点:前沿模型的推理痕迹蒸馏进 Qwen 3.5 0.8B 这类超小模型效果并不好,因为它们「太离策略」(off-policy)——太聪明、太简练,与目标模型的分布差距过大;用 27B 级别的模型做教师反而更合适。他还补充,Shopify 那类单轮简单任务并不受益于照搬前沿模型的输出,长程任务和编码任务才更可能从中获益。

对话另一方 VivaLaPanda 则质疑这一判断,指出「把大通用模型蒸馏成小任务模型」本就是业内普遍做法。

所属事件:JoshPurtell 拆解模型蒸馏之争:任务类型决定风险与可行性(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →