DeepSeek-V4-Flash 量化版 A100 实测:仅占 15.8GB 显存
Different-Pickle1021 · reddit · 2026-08-01
开发者在 A100 (40GB VRAM) 上使用 unsloth 的 GGUF 格式实测了 DeepSeek-V4-Flash-0731。在使用 Q8KXL 量化(162GB)并将所有专家层卸载至 CPU 的情况下,模型生成速度约为 16.1 tok/s,且仅占用了 15.8GB 的显存。
「Infra」频道最新
- Cloudflare 预告 AI Gateway 创新周新功能 — michellechen · 2026-08-01
- DeepSeek配华为芯推理利润率超OpenAI — zephyr_z9 · 2026-08-01
- OmniScope: 全模态大模型无损 token 压缩框架 — Jinsen Su · 2026-08-01
- a16z:AI 算力需求激增,但供应链瓶颈拖累基础设施交付 — a16z · 2026-08-01
- Atomic-Chat:支持完全离线运行的开源本地 AI 助手 — rohanpaul_ai · 2026-08-01
- 96GB Mac Ultra 搭建团队本地 LLM 服务实战指南 — BrandBikeRepeat · 2026-08-01