vLLM混合精度量化成功:Qwen3.6 27B模型2-8bit可用
victormustar · x · 2026-08-05
开发者bnjmnmarie成功在vLLM中实现混合精度量化(2、3、4、8-bit),结合AutoRound、LLM Compressor、自研repacker和vLLM 0.26的Humming Kernel,发布了多个Qwen3.6 27B量化模型(3.0/3.5/3.8/4.3-bit)。3.8-bit和4.3-bit版本表现良好,3.5-bit和3.0-bit版本尚在测试。该工作旨在为vLLM提供类似llama.cpp的层间混合量化灵活性,以减小模型体积。完整评估结果将于下周发布在博客上。
「编程与Agent」频道最新
- BullMQ沙箱机制致内存OOM,优化后降至18% — DanielLockyer · 2026-08-05
- 独立开发者洞察:用2-3个AI Agent替代完美合伙人 — yihui_indie · 2026-08-05
- DocDot 本地多解析器对比:支持 Apple 神经引擎 — CodeByPoonam · 2026-08-05
- DocDot 上线 Product Hunt:一键为本地 Agent 装配 PDF 解析技能 — CodeByPoonam · 2026-08-05
- 补齐 Claude Code 解析短板:DocDot 一键装技能 — CodeByPoonam · 2026-08-05
- 从被高估到真香:开发者分享百行代码实现多Agent内容审核 — Positive-Ad3618 · 2026-08-05