腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同
腾讯混元 · wechat · 2026-09-01
腾讯混元团队发布 AngelSlim 量化方案,成功将 Hy4-preview 模型(原重约 1.5TB)压缩至 214GB,大幅降低硬件门槛。核心技术包括:
- Sherry 稀疏三值量化:针对 MoE 路由专家进行激进压缩,平均每权重仅 1.25 比特。
- MIX-STQ10 混合精度策略:按层敏感度动态分配比特位,在压缩率与精度间取得平衡。
评测显示,量化版模型在长文、数学、代码等任务上能力损失极小,部分检索任务甚至优于原版。此外,团队联合 prima.cpp 验证了异构设备联合推理,将 214GB 模型在笔记本(4090)与服务器(4xA4000)间分布式运行,速度达 1.02 token/s,证明无需昂贵同构集群即可运行旗舰大模型。
相关 GGUF 库与代码已开源。
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01