SiliconBench:评测九款 Apple Silicon 引擎的速度、内存与保真度
PennState · hf · 2026-09-22
- SiliconBench 从速度、内存、保真度三个维度评测九款 Apple Silicon 统一内存桌面上的 LLM serving 引擎,覆盖 Qwen3、Qwen3.5、Gemma 4 的对话与 agent 负载,用分类任务对照 NVIDIA 参考检查质量回归,DGX Spark 作为补充参照。
- 关键发现:
- Qwen3-0.6B 上 vllm-metal 从并发 1 到 16 吞吐翻倍以上;CUDA vLLM 与 SGLang 并发扩展更强。
- 显式内存预算不等于内存余量:两套栈能完成所有请求但内存逼近物理上限、吞吐下滑。
- 新模型架构的引擎支持更窄;仅三套栈同时满足完成率、保真度与模型覆盖门槛。
- vllm-metal 打包的 prefill-decode 路径在并发下首 token 延迟低于 omlx。
- 双机配置中 Thunderbolt RDMA 上的张量并行可扩展,TCP 上的流水线并行反而退化。
- 基准代码、逐次结果与维护日志均已开源。
「Infra」频道最新
- python-build-standalone 为 CPython 3.12+ 启用全量 LTO 提升运行性能 — charliermarsh · 2026-09-22
- REAP 剪枝 Qwen3.8-Flash-Next MLX 版实测:三个档位怎么选 — MensaProdigy · 2026-09-22
- 开发者自述:DeepSeek V4 NVFP4 优化后 192GB 只剩 2GB 余量 — HankYeomans · 2026-09-22
- 「AWS 让行业变软」:AI 基础设施还没有躺赢的资本 — mgill25 · 2026-09-22
- Grass 网络获第三方审计:3 亿带宽用户贡献 3210 万美元营收 — Ronangmi · 2026-09-22
- SemiAnalysis 深文:MoE 模型如何映射到推理硬件的算力与数据搬运 — zephyr_z9 · 2026-09-22