DeepSeek V4 Flash 本地跑到百万上下文
Shoddy_Bed3240 · reddit · 2026-07-18
Reddit 用户分享了在 5090 上用 llama.cpp 跑 DeepSeek V4 Flash 的配置和实测结果,重点是把上下文拉到了 100 万 token。
他使用的是 Unsloth 提供的 GGUF 版本,并贴出了完整的 llama-server 启动参数,包括:
- 1,048,576 的上下文长度
- K/V cache 量化
- 多项 CPU/GPU 分配与 batch 参数
- 指定 chat template、重试惩罚和服务端口等
实测性能大致为:
- Prefill 约 650–700 tok/s
- Decode 约 17 tok/s
- 加载时间约 32 秒
作者认为速度还不如 Qwen 系列理想,但 llama.cpp 仍有优化空间。
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11