Qwen3 27B 开启 embeddings 后生成速度直接减半

No_Advance3911 · reddit · 2026-09-15

有用户在 llama.cpp 中测试 Qwen3 27B 的内置 embeddings 支持,发现效果尚可,但代价明显:开启 embeddings 后 token 生成速度比正常运行减半。

帖主向社区求教:有没有办法让 embeddings 保持开启的同时不影响生成性能;或者 llama.cpp 能否在不同任务间切换而不必每次卸载重载模型。这是一个本地部署场景下多任务复用同一模型的实际工程问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →