端侧MoE模型实测:NVIDIA Lightning比Qwen快2.5倍
parepeg · reddit · 2026-08-12
作者基于 Artificial Analysis 的数据和 llama.cpp 的本地测试,对比了 NVIDIA Lightning (30B) 与 Qwen3.6 (35B) 两款 MoE 模型的表现。
- 速度与智能的权衡:NVIDIA Lightning 在单任务处理上比 Qwen 快约 2.5 倍,适合不需要复杂推理的快速响应场景;而 Qwen 更为智能,但无论问题复杂与否,都会消耗固定的思考时间。
- 本地实测数据(基于 AMD Strix Halo 395 处理 20k Token):
- Lightning 30B:Prefill 1059 tok/s,Decode 53.48 tok/s。
- Qwen3.6 35B (开启 MTP):Prefill 988.78 tok/s,Decode 50.98 tok/s。
「Infra」频道最新
- 算力需求暴增:H100租赁价格半年飙升40% — jessi_cata · 2026-08-12
- AI数据中心商 DayOne 已秘密提交美股 IPO 申请 — davidyin44 · 2026-08-12
- 传 Anthropic 达成 91 亿美元算力协议,微软将大举扩产自研 AI 芯片 — 创业邦 · 2026-08-12
- AI芯片良率焦虑:晶圆级测试为何成算力供应链关键? — demian_ai · 2026-08-12
- RTX 4080 跑 Minimax Ref2V 频繁爆显存,如何生成长视频? — witcherknight · 2026-08-12
- Nvidia RTX 6000 Pro 官网标价飙升至 1.6 万美元 — Norwood_Reaper_ · 2026-08-12