Qwen3.6 35B-A3B 跑进 6GB 显存:131K 上下文 + 视觉,附完整 llama.cpp 配置
Szadbaverem69 · reddit · 2026-10-10
作者在 RTX 2060 6GB + 32GB DDR4 + i5-10400F 上成功运行 Qwen3.6-35B-A3B(Q4KM,Uncensored 版),131K 上下文 + 视觉能力。
关键做法与数据:
- MoE 专家层大部分放 CPU(--n-cpu-moe 39),这是 35B 能塞进 6GB 显存的核心。
- 视觉投影器跑 CPU(--no-mmproj-offload),显存控制在约 5.2GB 避免爆显存,图像编码稍慢但省出约 1GB。
- KV cache 用 Q80 量化,空缓存时约 600 tok/s prefill / 23 tok/s decode;上下文涨到 90k 后稳定在约 485 tok/s prefill / 15 tok/s decode。
- 帖子附完整可复制的 llama-server 启动命令(采样参数、mmap+mlock、--reasoning-format deepseek 等),作者还在征集优化建议。
「Infra」频道最新
- Bittensor 算力租赁月报:支出增 45%,租约失败率降 32% — markjeffrey · 2026-10-10
- 给 Grok Bot 配 pit crew:前沿模型做规划,免费模型干杂活 — alexcovo_eth · 2026-10-10
- AI 热潮变债务热潮:Oracle 5年CDS 近纪录261bp,隐含违约率20.4% — cyb3rops · 2026-10-10
- Fireworks AI 遭内部凭证被盗用,已撤销并称未见客户数据受影响 — lqiao · 2026-10-10
- 美国电网今年新增 86GW,AI 实验室需求达数百 GW — FinanceYF5 · 2026-10-10
- SpaceX 星舰工厂瞄准年产 1000 艘,佛州 Gigabay 体量超现厂房 11 倍 — XFreeze · 2026-10-10