DeepSeek-V4 黑卡部署实录:修复 SGLang 三大 Bug
shrug_hellifino · reddit · 2026-09-02
作者分享了在双路 RTX PRO 6000 Blackwell (SM120) 上通过 SGLang 运行 DeepSeek-V4-Flash-Vision-Exp 的经验,成功处理了 26.9 万 token 的上下文。过程中解决了三个关键问题:SM120 稀疏 MLA Vision prefill 崩溃(通过添加预填充能力检查并回退到 Triton 实现)、约 269k 上下文导致的索引器 CUDA OOM(通过行切片和分块处理限制显存占用)、以及 Vision 预览破坏多轮工具调用历史的问题。
「编程与Agent」频道最新
- Ethan Mollick:Agent 已具备长期自组织工作能力,需重构 AI 方法 — emollick · 2026-09-02
- 一个 PR 让 PII 脱敏模型可直接用 transformers 加载 — tomaarsen · 2026-09-02
- 求助:如何构建驱动老旧 ERP 系统的自主智能体 — atuclose · 2026-09-02
- Swarms v15 发布:引入动态工具加载与 MCP 2.x 支持 — KyeGomezB · 2026-09-02
- 开发者演示用 GPT 5.6 配合 Blender MCP 制作游戏动画 — chongdashu · 2026-09-02
- LLM 是神经符号系统,将在 Agent 群集时代复兴 — herbiebradley · 2026-09-02