Qwen3 27B 开启 embeddings 后生成速度直接减半
No_Advance3911 · reddit · 2026-09-15
有用户在 llama.cpp 中测试 Qwen3 27B 的内置 embeddings 支持,发现效果尚可,但代价明显:开启 embeddings 后 token 生成速度比正常运行减半。
帖主向社区求教:有没有办法让 embeddings 保持开启的同时不影响生成性能;或者 llama.cpp 能否在不同任务间切换而不必每次卸载重载模型。这是一个本地部署场景下多任务复用同一模型的实际工程问题。
「Infra」频道最新
- VMware 私有 AI 云评 9.1 分居首,数千企业可平滑引入 AI — DavidLinthicum · 2026-09-15
- SpaceX 总裁:算力租赁是门好生意,AI 需求毫无放缓迹象 — XFreeze · 2026-09-15
- Orthrus 研究揭示:无损投机解码仅在高数值精度下成立 — Ilya Koziev · 2026-09-15
- M3 Ultra 跑 DeepSeek V4.1 Flash 提速近一倍:31 t/s 解码、40 t/s 投机 — IngeniousIdiocy · 2026-09-15
- Trigger.dev 推出 chat.agent:AI 对话变成可崩溃恢复的长任务 — CodeByPoonam · 2026-09-15
- 甲骨文凌晨 6 点批量裁员:AI 订单膨胀烧钱,员工年减 2.1 万 — 量子位 · 2026-09-15