Strata 本地推理提速近一倍,RTX PRO 6000 实测压制 vLLM

hyudryu · reddit · 2026-10-10

Reddit 用户在单张 RTX PRO 6000(96GB)上实测 Unsloth 的 Qwen3.8-Flash-Next UD-Q4KXL 量化模型搭配新推理后端 Strata,并与 vLLM 对比。

作者承认两侧量化方案不同不完全公平,但 Strata 的加速幅度非常明显,Qwen 3.8 Flash Next 跑编码任务效率惊人。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →