TensorSharp 实测:本地跑 Muse Glimmer 30B 性能超 llama.cpp
fuzhongkai · reddit · 2026-08-14
开发者使用 NVIDIA RTX PRO 6000 Blackwell 显卡,在开源推理引擎 TensorSharp 上对 Meta 的 Muse Glimmer 30B GGUF 模型进行了基准测试,并与 llama.cpp 进行了深度对比。
核心结论:
- 纯文本生成:在短上下文(60-2050 tokens)下,TensorSharp 的 prefill 速度领先 16%-27%;但在长上下文(>16k tokens)下,llama.cpp 的 prefill 和 decode 速度均反超约 5%-14%。
- 投机解码(DFlash):在中等长度提示词下,TensorSharp 展现出惊人的加速效果(最高达 164.6 tok/s),但在长上下文场景下仍落后于 llama.cpp。
- 多 GPU 张量并行:使用 2× RTX PRO 4000 显卡进行 TP=2 测试时,prefill 和 decode 速度分别实现了 1.34 倍和 1.57 倍的显著提升。
TensorSharp 是一个支持 CUDA、Vulkan、Metal 及投机解码的本地 GGUF 推理引擎。
所属事件:TensorSharp 实测:本地推理多项性能超越 llama.cpp(2 条相关)→
「Infra」频道最新
- NVIDIA 新架构:让模型路由成为 AI 智能体的预算管家 — krishnan · 2026-08-14
- RTX 5060 Ti 跑 MiniMax H3 实测:分辨率是最大瓶颈 — danielcar · 2026-08-14
- RTX Pro 6000 显卡涨价:买整机送工作站 — Mr_Moonsilver · 2026-08-14
- NVIDIA Sol引擎适配LTX-2.5,实现最高4.68倍视频生成加速 — gan_chuang · 2026-08-14
- RTX 5090+5060Ti极限跑2.4T模型,实测0.8 tok/s — mossy_troll_84 · 2026-08-14
- Cerebras与Cisco财报强劲却遭抛售:AI算力供应链遇瓶颈 — TiernanRayTech · 2026-08-14