Strata 本地推理提速近一倍,RTX PRO 6000 实测压制 vLLM
hyudryu · reddit · 2026-10-10
Reddit 用户在单张 RTX PRO 6000(96GB)上实测 Unsloth 的 Qwen3.8-Flash-Next UD-Q4KXL 量化模型搭配新推理后端 Strata,并与 vLLM 对比。
- 配置:INT8 KV cache、256K 上下文、MTP-4 投机解码、每任务约 256 token 输出、每组任务跑两轮
- 单请求解码速度(tokens/s):写作 185.8、计数 320.4、编码 298.9、推理 289.1,全面领先
- 对比同卡的 vLLM(NVFP4 量化)快约 46-49%,对比 DGX Spark 双卡 TP2 快约 77-82%
作者承认两侧量化方案不同不完全公平,但 Strata 的加速幅度非常明显,Qwen 3.8 Flash Next 跑编码任务效率惊人。
「Infra」频道最新
- 月账单 1.14 万美元查不清去向:一个团队的 LLM 成本失控复盘 — vigilAPI · 2026-10-10
- 无人接盘:50 亿美元估值的 AI 数据中心公司撤回上市 — YvesMulkers · 2026-10-10
- MIT 物理学家 Lloyd 1999 年论文算清计算的物理极限 — burny_tech · 2026-10-10
- vLLM 语义路由新招:小模型先行,省 54% 成本还提准 16 分 — vllm_project · 2026-10-10
- 曝 NVIDIA 停产 RTX 5090,GB202 芯片将专供 RTX PRO 系列 — chemist_slime · 2026-10-10
- 放弃专用服务器:为什么用笔记本采集传感器流数据更靠谱 — IgorBrigadir · 2026-10-10