Qwen3.8-27B 单卡跑出 129.8 tok/s,vLLM 胜出
MaziyarPanahi · x · 2026-08-21
基准测试显示,Qwen3.8-27B BF16 在单张 NVIDIA GH200 上实现了 129.8 tok/s。配置包括 2048 输入 token 和 1536 强制输出 token。在单流场景下,vLLM + DFlash2 表现最佳,比普通自回归快 2.18 倍,比 MTP-3 快 9.4%。LambdaAPI 提供了算力支持。
所属事件:Qwen3.8-27B单张GH200跑出129.8 tok/s(2 条相关)→
「Infra」频道最新
- AI 算力缺电:电网成瓶颈,太阳能与储能是当前最快解 — PeterDiamandis · 2026-08-21
- ForkUnion开源SmashTable:带DBMS事务特性的内存容器 — srchvrs · 2026-08-21
- Marin利用Scaling Law预测训练轨迹,启动535B MoE — dlwh · 2026-08-21
- Qwen3.8-27B 启用 DFlash2 跑满 256k 上下文 — maddie-lovelace · 2026-08-21
- Miles 集成 Mooncake 后端,远程数据获取提速 14 倍 — BanghuaZ · 2026-08-21
- Google Cloud AlloyDB 借助四层树架构支持百亿级向量搜索 — rseroter · 2026-08-21