9B模型Token消耗减半:实测蒸馏版与原版能力无差异

GroundbreakingMall54 · reddit · 2026-08-05

一位开源本地 AI 应用开发者实测了 Qwen3.5-9B 的 DeepSeek-V4-Flash 蒸馏版,发现它是唯一能常驻 7GB 显存的同类模型。作者将其与参数量、量化方式和架构完全相同的原版 Qwen3.5-9B 进行对比,以单纯检验蒸馏带来的影响。

结果显示,在8项任务中有6项两者给出了一致的正确答案,几乎测不出推理差距。真正的差异在于 Token 消耗:蒸馏版在算术、日志查找、工具调用等任务上的输出长度大幅缩短(整体消耗从 8975 降至 5480)。作者认为,9B 规模的蒸馏主要带来的是“输出纪律”而非智力提升,这对需要下游程序解析输出的场景极为有利。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →