vLLM 发布 Inkling-Small 部署指南:最低180GB显存可跑
vllm_project · x · 2026-07-31
vLLM Recipes 官方发布了关于 Thinking Machines Lab 最新多模态 MoE 模型 Inkling-Small 的部署指南。
- 模型规格:总参数量 276B,激活参数 12B,支持原生图/文/音输入与文本输出,最高支持 1M 上下文。
- 硬件门槛:提供 NVFP4 和 BF16 两种精度方案。NVFP4 模式最低仅需 180GB 聚合显存(可在单张 B300/GB300 或双张 B200/GB200 上运行 TP1/TP2);BF16 模式则至少需要 600GB 显存。
- 推理加速:支持相对注意力机制、短卷积服务路径、工具与推理解析器,以及 MTP 推测解码。
- 环境配置:需要 vLLM nightly 版本,处理音频输入需额外安装 vllm[audio] 扩展。
「Infra」频道最新
- 开源项目收录 LLM 部署隐蔽陷阱 — alexcovo_eth · 2026-07-31
- 解码速度达 1万 token/秒,会解锁哪些 LLM 新场景? — LivingSwitch · 2026-07-31
- 推理优化带来10倍以上性能提升,GPU算力或重演暗光纤革命 — chandan1_ · 2026-07-31
- 斯坦福学者提出用「每瓦特智能」衡量 AI 效率 — StanfordAILab · 2026-07-31
- 数据中心耗水问题引关注:新一期播客探讨 — AndyMasley · 2026-07-31
- DeepSeek计划建设1GW数据中心,Anthropic目标9-10GW — zephyr_z9 · 2026-07-31