Qwen Flash打破「大内存」迷信:组合式PC架构重新成立
sn2006gy · reddit · 2026-09-18
Reddit 长帖讨论 Qwen Flash 类稀疏化模型对本地 AI 硬件选型的颠覆。作者核心论点:过去大家默认「模型大=必须超快超大显存」, hence 疯抢 5090、DGX Spark、大统一内存 Mac;但如果任意时刻只需激活几十亿参数,大部分知识可以放在稀疏访问的存储里,就不需要 100+GB 的 1TB/s 显存。
由此经典的组合式 PC 架构重新有意义:
- GPU 负责激活参数的计算
- RAM 做热数据缓存
- NVMe 存放巨型稀疏记忆
这样一台多 PCIe 通道的 Threadripper 工作站,可通过加内存/加 NVMe/换 GPU 分别扩展知识容量、缓存与算力,并发则可像 K8s 一样横向扩展 NVMe engram。作者建议社区别急着为 FOMO 买天价一体机,而是投入 Flash 式推理在普通硬件上的优化:expert caching、NVMe engrams、CPU/GPU 分工、llama.cpp 支持等。
「Infra」频道最新
- Gemini 托管 Agent 升级:成本降 30%,新增 Files 与 Credentials API — _philschmid · 2026-09-18
- 曝 OpenAI 顶级研究员每人每天烧 7000-8000 美元 Codex 算力 — venturetwins · 2026-09-18
- Nebius GB300 NVL72 整机架登顶 MLPerf:DeepSeek R1 每秒 60.3 万 tokens — demian_ai · 2026-09-18
- 新论文:三指标路由器让 16GB 消费级 GPU 长上下文 RAG 零 OOM — chaumian · 2026-09-18
- 曝 Meta 自研芯片 MTIA 450 将于 2027 上半年进入数据中心 — Beth_Kindig · 2026-09-18
- 华为发布 Peerium 架构与 Atlas 960E SuperPoD:百万卡如一台机器 — pstAsiatech · 2026-09-18