单张RTX 3090跑30B模型:W4A16量化实现4.5倍吞吐量提升

mitchins-au · reddit · 2026-08-14

开发者针对NVIDIA Nemotron 3.5 Lightning 30B-A3B模型发布了适用于VLLM的W4A16量化版本,使其能够完全载入单张24GB显存的RTX 3090显卡。

测试表明,相较于llama.cpp上的IQ4XS GGUF格式,W4A16在VLLM服务下的吞吐量提升了数倍(B16批次下约4.5倍)。基准测试显示,两者在指令遵循等核心能力上几乎没有差异。该方案非常适合在消费级硬件上进行批量数据标注或对编码能力要求不高的智能体任务。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →