llama.cpp 新增 LFM2/MoE 模型张量切分支持,推理性能提升显著
pmttyji · reddit · 2026-08-21
llama.cpp 社区提交了为 LFM2 和 LFM2MoE 模型家族添加 --split-mode tensor 支持的 PR,并在 2x RTX A5000 (NVLink) 上进行了详细测试。
功能更新:
- 新增对 LFM2/LFM2MoE 模型的张量切分(tensor split)支持,允许将模型分布在不同 GPU 上运行。
准确性与性能测试:
- 准确性:测试通过,Meta NMSE 保持在 1e-14 量级;困惑度(PPL)在不同量化级别下几乎无变化,Top-p 预测一致性高(>90%)。
- 性能提升:
- LFM2.5-2.6B 模型:Token 生成速度提升约 8%-35%(取决于量化级别),Prompt 处理提升约 24%-34%。
- LFM2.5-VL-3B 模型:Prompt 处理提升约 23%-31%,Token 生成提升约 14%-23%。
- LFM2.5-8B-A1B 模型:Prompt 处理提升约 28%-31%。
- 部分配置(如 8B-A1B BF16)在 Prompt 处理上出现性能下降(-35.1%),但多数场景表现优异。
「Infra」频道最新
- DeepSeek v4 Flash 两周流量暴增 6 倍,极致性价比驱动 — teortaxesTex · 2026-08-21
- Wake:统一 13 款 Code Agent 会话的 macOS 原生工具 — aigclink · 2026-08-21
- 设置 CPU Limit 会让 K8s 应用变慢?这里有复现实验与证明 — JeremyCMorgan · 2026-08-21
- AI 应用如何上生产?实战演练 OpenTelemetry 与值班 Agent — Al_Grigor · 2026-08-21
- LLMRouter 2.0:统一路由开发与评测基准 — youjiaxuan · 2026-08-21
- 12GB 显卡本地跑 MiniMax H3:15 秒多镜头视频模板 — vortis23 · 2026-08-21