DeepSeek-V4-Flash 本地推理提速至 120 tokens/s

danielhanchen · x · 2026-08-06

Unsloth AI 宣布通过 DSpark 工具,DeepSeek-V4-Flash-0731 的 GGUF 量化版本在本地运行速度可提升 1.4 至 2 倍,且不损失精度。优化后该模型的生成速度最高可达 120 tokens/s。

所属事件:DeepSeek V4 Flash跑分曝光,性能反超Pro版(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →