全精度大模型能否靠流式推理跑起来
HumanDrone8721 · reddit · 2026-07-19
有人询问:NVIDIA TensorRT-LLM 或类似 DeepSpeed 的流式框架,是否真的能在**VRAM + 系统内存都装不下完整权重**的机器上,跑未量化、未修改的 MoE 模型。 问题的重点不是模型本身,而是这些“伪统一内存/流式加载”方案在真实环境中的可用性与性能:是否有实际成功案例,延迟和吞吐大概如何,以及它们是否能超出学术演示场景,落地到日常推理。
「Infra」频道最新
- 高通预览端侧 GGUF 运行工具GenieX — carrycooldude · 2026-07-20
- DwarfStar 让 Ada 卡盒变推理服务器 — antirez · 2026-07-20
- DwarfStar 新增多项推理优化 — antirez · 2026-07-20
- BMS 在 Vera Rubin 上建 AI 工厂 — nordicinst · 2026-07-20
- Hut 8 签下98亿美元AI租约 — sunychoudhary · 2026-07-20
- 中国开源模型重塑AI经济学 — Stratechery · 2026-07-20