双RTX6000本地跑DeepSeek-V4-Flash-Vision:350K上下文@7并发

DeedleDumbDee · reddit · 2026-09-03

作者将工作用 LLM 服务器从 DSV4-Flash-0731 升级到新的 Vision-EXP 模型,用 OpenWebUI 连接 vLLM 容器实测。

部署细节:解决了 KV cache 内存问题后,实现 250 万 token KV cache,350K 上下文下支持 7 路并发,速度约 120 tok/s 生成、3000-7000 tok/s 预填充。

测试内容:要求模型生成单个自包含 HTML 文件,用 Three.js 渲染动画太阳系,包括真实轨道周期(水星 0.24 年到海王星 164.8 年)、开普勒方程数值求解、真实轨道离心率与倾角、行星轴倾角、NASA 确认的真实卫星数量(木星 115 颗、土星 293 颗)、InstancedMesh 渲染卫星群、轨道控制与倍速 UI 等。属于本地部署大型视觉模型的实用参考。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →