腾讯混元 Hy4-preview 亮相 vLLM:770B MoE 配 1M 上下文
TencentHunyuan · x · 2026-08-30
vLLM 官方宣布腾讯混元 Hy4-preview 从发布首日即支持 vLLM,并在 NVIDIA GPU 上完成验证。
架构要点:
- 总参数 770B,每 token 激活 49B;78 层中第一层为 dense FFN,其余 77 层用 256 个路由专家(top-8)+1 个共享专家
- 支持 1M 上下文,但每个 query 只 attend 到 2048 个 token(Gated DeepSeek Sparse Attention + IndexCache 实现跨层稀疏索引复用,78 层中仅 21 层自行计算稀疏索引)
- checkpoint 内置 10B 参数的 MTP 层(激活 0.7B,draft 深度 3)用于投机解码
部署:FP8 版本可在 16×B200 或 8×B300 上运行,通过 VLLMENABLEHPCOPS=1 启用腾讯 HPC-Ops 注意力与 MoE 内核(自 Hy3 起已进入 vLLM 主线),配合 MTP 投机解码与 hyv4 工具/推理解析器即可提供服务。
「Infra」频道最新
- 英国高管警告:电信升级滞后或致其落后全球 AI 竞赛 — nordicinst · 2026-08-30
- 不仅要掌控模型调用,更要掌控模型层本身 — omarsar0 · 2026-08-30
- GLM 5.3 Flash 本地推理极慢,苹果硅芯片尚无优化 — CentrifugalMalaise · 2026-08-30
- M4 Max 跑 Qwen3.8-27B:长上下文下 oMLX 胜出,前缀缓存最提速 — vitordeas · 2026-08-30
- 开源后端 Oberik:解决 Agent 文档解析与多租户痛点 — kahveciderin · 2026-08-29
- CUDA 开发者详解“粘性错误”与设备端未定义行为 — blelbach · 2026-08-29