AMD 官方晒账:MI355X 软件调优叠加 vLLM 升级,吐 token 成本直降 31%
ryanshrout · x · 2026-10-03
AMD 高管 Ryan Shrout 引用 Signal65 的 PINNACLE 实测,展示 MI355X 在 MiniMax-M3 推理上的软件优化收益:
- 同节点、同负载、同 vLLM 构建,仅换 AMD 官方 serving 配置:峰值吞吐 +11%,轻载下单 agent 解码速度提升 2.4 倍
- 升级到 vLLM 0.30.1 后再 +30%,合计 1.44 倍
- 综合效果:在已有硬件上每输出 token 成本降低 31%
结论呼应其观点:「硬件决定上限,软件决定你能逼近多少」。
「Infra」频道最新
- 爆料:xAI 11 月将上线约 42 万块英伟达 GPU 履行算力承诺 — mark_k · 2026-10-03
- 开源 MCP 服务器压测工具 mcpload,30 分钟 3780 会话零错误 — AKM121001 · 2026-10-03
- AI Conference Day 2:Agent推理成本与监控成全场焦点 — sanjaykalra · 2026-10-03
- Apple M5 Ultra 256GB 上下文实测:Qwen 量化模型 prefill 速度亮眼 — antirez · 2026-10-03
- Fractile 创始人谈 AI 芯片市场:如何结构性取胜与内存带宽瓶颈 — saranormous · 2026-10-03
- 软银 31 亿美元收购数据中心投资管理公司,扩建靠借债 — YvesMulkers · 2026-10-03