单张 RTX 5090 跑 502GB 模型:DeepSeek V4.1-Flash 展示本地 AI 新架构
AccBalanced · x · 2026-09-12
开发者实测 DeepSeek-V4.1-Flash 在单张 RTX 5090 + 125.7 GiB 内存上运行,502GB 的 GGUF 模型大部分驻留 NVMe:热专家在 VRAM/RAM 中流动,冷专家留在 SSD,196B 的 Engram 记忆由磁盘支撑。
关键数据:
- 552B 主干 + 196B Engram 记忆
- 输入时仅 8B 激活/token,输出时 16B
- 新内容生成 5.12 tok/s,数据驻留时最高 21.27 tok/s
- 与参考模型 logit 相关系数 0.9967
评论认为这与 Qwen3.8-Flash-Next 一起表明:模型容量正与活跃算力解耦,热数据查表式稀疏访问(Engram 非积极参与矩阵运算)可能是超大规模模型本地部署的蓝图。
「Infra」频道最新
- TensorSharp 在 8×A40 上把 DeepSeek V4.1 Flash 解码优化到 41 tok/s — fuzhongkai · 2026-09-12
- 网友盘点 2026 年真能跑 AI 的边缘设备:Mac 到 iPhone 17 Pro — MaziyarPanahi · 2026-09-12
- 双 3090 跑 Qwen3.8 Flash Next:llama.cpp 配置求调优,附完整参数 — ChopSticksPlease · 2026-09-12
- 遭伊朗袭击后,阿联酋 5GW AI 园区改设计为抗打击分布式布局 — mark_k · 2026-09-12
- 团队日跑100-200个Agent后发现:瓶颈已从算力变成磁盘空间 — vincent_koc · 2026-09-12
- Orca 发布 DeepSeek V4.1 Flash 去审查 MLX 权重,面向安全研究 — AccBalanced · 2026-09-12