vLLM混合精度量化成功:Qwen3.6 27B模型2-8bit可用

victormustar · x · 2026-08-05

开发者bnjmnmarie成功在vLLM中实现混合精度量化(2、3、4、8-bit),结合AutoRound、LLM Compressor、自研repacker和vLLM 0.26的Humming Kernel,发布了多个Qwen3.6 27B量化模型(3.0/3.5/3.8/4.3-bit)。3.8-bit和4.3-bit版本表现良好,3.5-bit和3.0-bit版本尚在测试。该工作旨在为vLLM提供类似llama.cpp的层间混合量化灵活性,以减小模型体积。完整评估结果将于下周发布在博客上。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →