LM Studio 原生性能落后 raw llama.cpp 40%
MkGod · reddit · 2026-08-24
作者在双 RTX 5060 Ti (32GB VRAM) 上对比了 LM Studio 与原生 llama-server.exe 运行 Qwen3.8-27B 的性能差异。
性能对比:
- LM Studio:30–40 tok/s。
- Raw llama-server.exe:50–55 tok/s(快约 40%)。
- 配置完全相同(TP、MTP 投机采样),排除了显存溢出问题。
问题分析:
- 排测是 GUI 封装开销、Context shift 或 KV cache 碎片导致。
- llama.cpp 警告:SPLITMODETENSOR 下采样后端回退 CPU,但性能仍远超 LM Studio。
推理参数差异:
- 加载 lmstudio-community 版 GGUF 时显示完整的 Reasoning Effort 选项。
- 加载 Unsloth 版 GGUF 时仅显示 开/关 切换。
- 疑问:这是否由 GGUF 元数据/Jinja 模板决定,还是 LM Studio 硬编码限制?
「Infra」频道最新
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24
- 超算中心硬件选型:SSD与HDD的密度权衡 — generativist · 2026-08-24
- 三星展示 HBM 散热新方案,芯片性能存差异 — BenBajarin · 2026-08-24
- Tobi 开源 walgit:无数据库的单二进制 Git 服务器 — jevon · 2026-08-24
- s3collections:用S3构建分布式系统持久化数据结构 — andersonbcdefg · 2026-08-24
- 预测市场:年底前美一州实施数据中心禁令概率 68% — Polymarket · 2026-08-24