实测 Intel Arc B70 显卡:Qwen3.8 跑出 52 tok/s
No-Dot-Not · reddit · 2026-08-22
作者在 Linux 环境下实测了 Intel Arc Pro B70 (32GB) 显卡运行 Qwen3.8-27B INT4 模型的性能。使用 vLLM XPU 后端并开启 MTP2 推测解码,在 64K 上下文下达到了 52.2 tok/s 的 median 解码速度,比 llama.cpp SYCL 快 1.8 倍。测试涵盖了 128K 上下文的 needle-in-haystack 验证、视觉能力、工具调用以及真实的代码 Agent 任务。文章还指出了当前 XPU 堆栈的若干 Bug 和局限性(如并发请求需限制序列数),结论是 B70 配合特定栈可作为可用的 32GB 推理卡。
「Infra」频道最新
- 网友提议将海上石油平台改造成数据中心 — beffjezos · 2026-08-22
- OpenAI 域名记录暗示其正并行构建银行级与硬件基础设施 — imjustnewatai · 2026-08-22
- AI 耗能惊人:ChatGPT 查询耗能是谷歌搜索 10 倍 — ingliguori · 2026-08-22
- Google Cloud 推出 Global Front End 跨云网络方案 — rseroter · 2026-08-22
- 观点:禁止数据中心是“奢侈的信仰”,将重创经济 — robleclerc · 2026-08-22
- 模型能效还能提升100倍吗?需架构与推理大变革 — prateekj · 2026-08-22