Strix Halo 上 ROCm 反超 Vulkan:解码最快 41.9 tok/s,提速 28%-47%
QuixiAI · x · 2026-09-17
Lucebox 团队分享其在 AMD Strix Halo 上把 ROCm 推到超过 Vulkan 后端的成果:同一天、同一台机器、同一 prompt 下,Lucebox 引擎(ROCm)与 llama.cpp(Vulkan)对比。配合 DSpark drafter,Lucebox ROCm 在 8K 上下文解码达 41.9 tok/s,123K 长上下文下 38.0 tok/s,比 llama.cpp/Vulkan v0.7.5 快 28%-47%,prefill 快 17%-47%。作者认为这对所有 Strix Halo(AMD AI Max)本地产推理用户是利好。
「Infra」频道最新
- Cloudflare 上线首个隐身模型 Union Alpha,并行调用多模型融合答案 — ritakozlov · 2026-09-17
- Qwen3.8-Flash-Next 实测:254K 长上下文首 token 提速 1.56 倍 — FantasticNature7590 · 2026-09-17
- 隐私 LLM 服务 Venice 日处理 token 量达 2500 亿,三月翻 2.5 倍 — 0xAllen_ · 2026-09-17
- Baseten 推出 Hosted Tools:开源模型首次获服务端实时联网搜索 — baseten · 2026-09-17
- 开发者提议 Claude Code 应做预测性动态上下文缓存 — Sauers_ · 2026-09-17
- Starlink 拉美农村联网大扩张:洪都拉斯万台天线连 8000 所学校 — NicoVerderosa · 2026-09-17