单张 RTX 5090 跑 502GB 模型:DeepSeek V4.1-Flash 展示本地 AI 新架构

AccBalanced · x · 2026-09-12

开发者实测 DeepSeek-V4.1-Flash 在单张 RTX 5090 + 125.7 GiB 内存上运行,502GB 的 GGUF 模型大部分驻留 NVMe:热专家在 VRAM/RAM 中流动,冷专家留在 SSD,196B 的 Engram 记忆由磁盘支撑。

关键数据:

评论认为这与 Qwen3.8-Flash-Next 一起表明:模型容量正与活跃算力解耦,热数据查表式稀疏访问(Engram 非积极参与矩阵运算)可能是超大规模模型本地部署的蓝图。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →