vLLM 支持 RAM offload,4 张 R9700 本地跑通 DeepSeek-V4 视觉实验版
sloptimizer · reddit · 2026-09-30
Reddit 用户 sloptimizer 分享:得益于 tcclaviger 的贡献,vLLM 新增了 RAM offloading 支持,让前沿大模型在本地部署变得可行。作者成功在 4 张 AMD R9700 上运行了原始的 DeepSeek-V4-Flash-Vision-Exp。
帖内附完整可复制的 podman 启动命令,关键参数包括:
- --tensor-parallel-size 4 配合 --enable-expert-offload --expert-offload-mem 160 实现专家权重卸载到内存
- --kv-cache-dtype fp8、--block-size 256、--max-model-len 256000 优化显存占用与长上下文
- dspark 投机解码(numspeculativetokens=3)加速推理
- 启用 prefix caching、chunked prefill、auto tool choice 与 deepseekv4 解析器
「Infra」频道最新
- OpenAI 推出 Ultrafast 极速档:Codex 最高 300 tokens/秒、快 8 倍 — OpenAI · 2026-09-30
- OpenAI Responses API 流量一年涨 100 倍,可用性达 99.9% — TheMoonMidas · 2026-09-30
- Rust 开源 AgentMesh:给 MCP 生态做服务网格,一个网关纳管 49 个工具 — Excellent-Book-3509 · 2026-09-30
- 高通 HBC 首份良率数据曝光,行业分析师密切关注 — BenBajarin · 2026-09-30
- Yuchen 吐槽分层定价:快 2 倍贵 2 倍,「超快」要 6 倍价格 — Yuchenj_UW · 2026-09-30
- OpenAI 自曝「tokenmaxxing」:训练推理都烧爆 token — BorisMPower · 2026-09-30