全精度大模型能否靠流式推理跑起来

HumanDrone8721 · reddit · 2026-07-19

有人询问:NVIDIA TensorRT-LLM 或类似 DeepSpeed 的流式框架,是否真的能在**VRAM + 系统内存都装不下完整权重**的机器上,跑未量化、未修改的 MoE 模型。 问题的重点不是模型本身,而是这些“伪统一内存/流式加载”方案在真实环境中的可用性与性能:是否有实际成功案例,延迟和吞吐大概如何,以及它们是否能超出学术演示场景,落地到日常推理。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →