llama.cpp 对 Qwen 上下文内存效率不佳?用户实测对比
nullc · reddit · 2026-08-14
用户发现 llama.cpp 在相同硬件上,Qwen 架构的上下文内存效率明显低于 muse glimmer:glimmer 可支持 24 个 128k 上下文,而 Qwen 仅支持 3 个 256k 或 6 个 128k。尽管架构分析显示 Qwen 每 token 状态更小,但实际表现相反,推测 llama.cpp 对 Qwen 支持存在内存效率问题,影响批处理性能。
「Infra」频道最新
- 提问:微调超1T开源模型后,最简单的推理托管方式是什么? — maksym_andr · 2026-08-14
- CoreWeave亏损翻倍、烧钱加剧,但投资者看好千亿订单 — rohanpaul_ai · 2026-08-14
- 什么是 prefill-decode 分离?现代推理栈为何转向此架构? — scareme_please · 2026-08-14
- Namecheap数据中心冷却故障致服务中断,部分服务已恢复 — evilsocket · 2026-08-14
- OpenAI发布GPT-5.6构建者指南:账单从33美元降至1.33美元 — xiaohu · 2026-08-14
- Google免费发布GPU大师课,助你掌握硬件优化 — mdancho84 · 2026-08-14