96GB Strix Halo 跑 Qwen Flash Next 262k 上下文,求提速方案
Forward_Jackfruit813 · reddit · 2026-09-05
作者在 96GB Strix Halo 本地运行 Qwen Flash Next(IQ4XS,262k 上下文),把 NGRAM 卸载到 SSD,通过 draft-mtp 投机采样等 llama.cpp 配置已达所需智能水平,现想进一步提速:满上下文时约 50PP/14Decode。帖内附完整 llama.cpp 启动参数(KV cache f16、flash-attn、slot-save 等),并征求硬件升级(如 m.2 转 OCuLink 外接 V620 32GB)或软件层面建议,也在考虑 27B 模型是否够快。
「Infra」频道最新
- SGLang 开源 Breakable CUDA Graph:Prefill 建图提速 3.8–5.2 倍 — ying11231 · 2026-09-05
- SemiAnalysis:OpenAI 自研 ASIC 意在吓退 NVIDIA,输赢都赚 — MarvinTBaumann · 2026-09-05
- 分析师:2027 年是算力供给最紧之年,2028 年才现缓解 — BenBajarin · 2026-09-05
- 担心模型被下架,开发者自建 P2P 网络做开源权重模型的做种分发 — Relevant-Magic-Card · 2026-09-05
- NVIDIA 拆解投机解码:5 条准则平衡 LLM 推理吞吐与延迟 — NVIDIAAI · 2026-09-05
- Qdrant 1.19.1 发布:量化 HNSW 搜索提速最高 2.5 倍 — qdrant_engine · 2026-09-05