TileRT×AMD 在 8×MI355X 上跑 GLM-5.3 达 469 tok/s,比 GB300 FP4 快 40%
vllm_project · x · 2026-09-25
vLLM 项目宣布 TileRT 与 AMD 团队在 SemiAnalysis AgentX 基准上,用 8×MI355X 通过 vLLM 把 GLM-5.3 单用户解码推到 469 tok/s,SemiAnalysis 称这比使用 FP4 的 GB300 TRTLLM 快 40% 以上。架构上采用分离式部署:vLLM 负责计算密集的 prefill,TileRT 通过 vLLM V1 连接器接口接管延迟敏感的 decode,在保持原生 vLLM 服务栈的同时获得 TileRT 的单用户解码速度。
所属事件:vLLM 集成 TileRT,AMD 8×MI355X 跑 GLM-5.3 比 GB300 快 40%(2 条相关)→
「Infra」频道最新
- 传 AMD 四季度 AI GPU 与消费卡全线涨价约 10% — Beth_Kindig · 2026-09-25
- 谷歌 SunCatcher 太空数据中心卫星下周发射,算力竞赛出逃地球 — krishnan · 2026-09-25
- Wafer 为 Brilliant AI 家教 Koji 提供低延迟推理支撑 — ycombinator · 2026-09-25
- RAM 涨价逼出的土办法:跨设备拼接闲置内存跑 30B 本地模型 — Medicine_Blogscanner · 2026-09-25
- 10 年期美债破 5.2%,交易员:这次是算力问题不是石油 — km · 2026-09-25
- 内存涨价解方?博主称智能手机消耗全球 30% DRAM 与 NAND 供应 — AlpinDale · 2026-09-25