llama.cpp 实测:低内存与双卡跑 Qwen 新模型提速

社区用户围绕 Qwen3.8-Flash-Next 模型分享 llama.cpp 优化经验:有人利用 mmap 功能,将 IQ3XSS 量化版模型装入 16G 内存加 64G 交换空间的机器,运行速度达 26 token/s;另有作者在双 RTX 3060 加 7800X3D 环境下测试,发现默认的 -sm tensor 模式存在问题,调整后预填阶段速度提升 10 倍。

2026-08-28 ~ 2026-08-28 · 1 条相关