llama.cpp 对 Qwen 上下文内存效率不佳?用户实测对比

nullc · reddit · 2026-08-14

用户发现 llama.cpp 在相同硬件上,Qwen 架构的上下文内存效率明显低于 muse glimmer:glimmer 可支持 24 个 128k 上下文,而 Qwen 仅支持 3 个 256k 或 6 个 128k。尽管架构分析显示 Qwen 每 token 状态更小,但实际表现相反,推测 llama.cpp 对 Qwen 支持存在内存效率问题,影响批处理性能。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →