Qwen3.6-35B 本地推理完整 llama-server 参数配置分享
haydendevs · x · 2026-09-22
作者分享了一套用 llama-server 本地跑 Qwen3.6-35B-A3B-MTP-UD-Q4KXL 量化模型的完整启动命令:
- 上下文 131072、预测 32768,-fitt 1536 限制拟合长度
- Flash Attention 开启,K/V/cache 各项量化到 q80 省显存
- --spec-type draft-mtp 启用 MTP 投机解码,--spec-draft-n-max 2
- --ctxcp 64、--no-mmap、--mlock、--no-warmup 优化内存行为
- 聊天模板参数 preservethinking:true 保留思考过程
- 采样参数:temp 0.6、top-p 0.95、top-k 20,关闭重复惩罚
监听 0.0.0.0:8080,可直接作为 OpenAI 兼容 API 使用,适合想本地部署大上下文 MoE 模型的开发者照抄。
所属事件:Qwen3.6-35B 经量化可在单张 RTX 4070 上流畅运行(3 条相关)→
「Infra」频道最新
- 传银行暂停算力借贷,AI 信贷紧缩信号浮现 — citrini · 2026-09-22
- 加州连签七法案:AI 数据中心须自付电网水网升级费用 — The Verge AI · 2026-09-22
- O'Reilly 撰文拆解 AI 时代数据词汇:从数据仓库到本体论 — rseroter · 2026-09-22
- 英国最强 AI 超算 Isambard-AI 造价 2.25 亿英镑,与一座桥相当 — emax · 2026-09-22
- exe.dev 走红开发者圈:SSH 即虚拟机,配 Shelley 编码 agent — davidcrawshaw · 2026-09-22
- NVIDIA 牵头三方会谈,Artificial Analysis 出任韩国主权 AI 独立评估方 — ArtificialAnlys · 2026-09-22