双RTX6000本地跑DeepSeek-V4-Flash-Vision:350K上下文@7并发
DeedleDumbDee · reddit · 2026-09-03
作者将工作用 LLM 服务器从 DSV4-Flash-0731 升级到新的 Vision-EXP 模型,用 OpenWebUI 连接 vLLM 容器实测。
部署细节:解决了 KV cache 内存问题后,实现 250 万 token KV cache,350K 上下文下支持 7 路并发,速度约 120 tok/s 生成、3000-7000 tok/s 预填充。
测试内容:要求模型生成单个自包含 HTML 文件,用 Three.js 渲染动画太阳系,包括真实轨道周期(水星 0.24 年到海王星 164.8 年)、开普勒方程数值求解、真实轨道离心率与倾角、行星轴倾角、NASA 确认的真实卫星数量(木星 115 颗、土星 293 颗)、InstancedMesh 渲染卫星群、轨道控制与倍速 UI 等。属于本地部署大型视觉模型的实用参考。
「模型」频道最新
- 账号被盗直接升 $200 ChatGPT Pro,OpenAI 与银行均无拦截 — CucharitaDePalo · 2026-09-03
- Muse Spark 1.3发布引关注,网友提醒别错过 — D3VAUX · 2026-09-03
- 64GB Mac 用户求荐 40B 以下 MoE,Qwen 新版 35B 值得等吗 — chibop1 · 2026-09-03
- xAI 疑似密测 750tps 新模型 Sol,或与 Astra 同日上线 — koltregaskes · 2026-09-03
- 微软发布 MAI-Transcribe-2:WER 2.0% 居第二,411 倍实时仅 $1.67/千分钟 — ArtificialAnlys · 2026-09-03
- Claude Fable 5.1达SimpleBench 86.6%,首超人类基线 — Profanion · 2026-09-03