96GB Strix Halo 跑 Qwen Flash Next 262k 上下文,求提速方案

Forward_Jackfruit813 · reddit · 2026-09-05

作者在 96GB Strix Halo 本地运行 Qwen Flash Next(IQ4XS,262k 上下文),把 NGRAM 卸载到 SSD,通过 draft-mtp 投机采样等 llama.cpp 配置已达所需智能水平,现想进一步提速:满上下文时约 50PP/14Decode。帖内附完整 llama.cpp 启动参数(KV cache f16、flash-attn、slot-save 等),并征求硬件升级(如 m.2 转 OCuLink 外接 V620 32GB)或软件层面建议,也在考虑 27B 模型是否够快。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →