Qwen3.6-35B 本地推理完整 llama-server 参数配置分享

haydendevs · x · 2026-09-22

作者分享了一套用 llama-server 本地跑 Qwen3.6-35B-A3B-MTP-UD-Q4KXL 量化模型的完整启动命令:

监听 0.0.0.0:8080,可直接作为 OpenAI 兼容 API 使用,适合想本地部署大上下文 MoE 模型的开发者照抄。

所属事件:Qwen3.6-35B 经量化可在单张 RTX 4070 上流畅运行(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →