DGX Spark 上花 26 小时蒸馏 DeepSeek V4 Flash,4B 小模型单次判断仅 22ms
Dan_Jeffries1 · x · 2026-09-19
日本开发者 @taroleo 分享了一次本地蒸馏实验:用 DGX Spark 花约 26 小时,把权重 157GB 的 DeepSeek V4 Flash 的判断能力蒸馏到一个 4B 小模型中。
关键结果:
- 蒸馏时舍弃 text/ 生成,只保留判断任务,单次推理可做到约 40ms
- 4B 模型仅约教师模型 1/20 体积,判断准确度已超过教师的"即答模式"
- 每次判断约 22ms,全程纯本地 LLM 运行
作者的思路是:与其让大模型输出完整 JSON,不如砍掉生成只做分类判断,速度可以量级式提升。这是端侧部署 + 蒸馏的一个可参考案例。
「Infra」频道最新
- $250 淘矿卡魔改 30GB 显存,老 i7 主机跑 Qwen 达 30 tok/s — HFq_Dev · 2026-09-19
- 读懂一次预训练:P0/P1/P2 三级指标体系系统梳理训练监控信号 — SonglinYang4 · 2026-09-19
- 双 5060 Ti 跑 Qwen3.8-Flash-Next 仅 10 t/s,楼主求解优化配置 — MkGod · 2026-09-19
- 用 sglang 评分端点微调推理,让开源模型秒变指定风格 — BLUECOW009 · 2026-09-19
- Positron 融资 8.75 亿美元,播客激辩数据中心泡沫与能源瓶颈 — 20VC · 2026-09-19
- 双 RTX 3060 跑 Qwen3.8-27B 实测数据与 $2000 扩容方案讨论 — gnoremepls · 2026-09-19