众包优化使 Qwen 27B FP8 在单卡 H200 上较 vLLM 原生快 3.5 倍

const_reborn · x · 2026-09-07

Paretonai 报告其矿工社区通过竞赛方式,把 Qwen3.8-27B-FP8 在单张 H200 上端到端推理速度做到原生 vLLM 的 3.5 倍(基于 SWE-agent 轨迹中位数):

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →