DGX Spark 上花 26 小时蒸馏 DeepSeek V4 Flash,4B 小模型单次判断仅 22ms

Dan_Jeffries1 · x · 2026-09-19

日本开发者 @taroleo 分享了一次本地蒸馏实验:用 DGX Spark 花约 26 小时,把权重 157GB 的 DeepSeek V4 Flash 的判断能力蒸馏到一个 4B 小模型中。

关键结果:

作者的思路是:与其让大模型输出完整 JSON,不如砍掉生成只做分类判断,速度可以量级式提升。这是端侧部署 + 蒸馏的一个可参考案例。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →