腾讯混元 Hy3 推出 1bit/4bit 量化版,可单卡部署

腾讯混元团队围绕开源旗舰模型 Hy3(295B 参数的 MoE)推出量化与部署优化,提供 1bit 与 4bit 的 GGUF 量化版本,并强调配合 llama.cpp 等推理方案后,该模型可在单张 GPU 上运行。对于关注大模型本地部署的人来说,这次更新的核心意义在于把原本门槛极高的旗舰模型进一步推向更易试用的硬件环境。

关键细节

据腾讯混元官方发布及多条转述,本次提供的是 Hy3 的 1bit 与 4bit GGUF 量化版本,重点围绕推理可用性展开。官方建议配合 llama.cpp 使用,并提及可结合 MTP 运行;通过量化与相应推理方案,Hy3 可在单卡 GPU 上部署。多条转述也指出,官方称 Hy3 在同尺寸模型中表现领先,可与更大规模的旗舰模型竞争。

背景与影响

Hy3 被定位为 295B 级别的旗舰 MoE 模型。本组帖子未给出更完整的基准结果、具体单卡配置或实测性能数据,因此现阶段能确认的核心增量,主要是低比特量化版本的放出与单卡部署方向的推进——把旗舰级模型拉到更亲民的硬件门槛,是其面向落地场景最实际的卖点。

2026-07-14 ~ 2026-07-15 · 5 条相关

一手来源

另有 2 条近重复转述:huggingface · _akhaliq