Qwen3.6-35B 经量化可在单张 RTX 4070 上流畅运行

开发者 haydendevs 分享第一手体验:Qwen3.6-35B(MoE 架构,每次仅激活约 3B 参数)经量化后在单张 RTX 4070 消费级显卡上运行表现相当不错。他还公开了用 llama-server 本地运行 Qwen3.6-35B-A3B-MTP-UD-Q4KXL 量化版本的完整启动参数配置,包括 131072 上下文长度、32768 预测长度等,显示 35B 级模型已可在消费级硬件上本地部署。

2026-09-22 ~ 2026-09-22 · 3 条相关