腾讯混元推轻量版:权重压缩 85%,性能持平
智东西 · wechat · 2026-09-01
腾讯发布混元旗舰模型 Hy4preview 的轻量版,通过自研 Sherry 稀疏三值量化算法和 MIX-STQ1.0 混合精度策略,将模型权重从 1.5TB 压缩至 214GB。测试显示,压缩后模型在长文理解、多轮检索等任务上与原版基本持平,数学能力小幅回落。基于分布式推理框架 prima.cpp,团队验证了在异构设备(如 4090 笔记本与 A4000 服务器)上协同运行该模型的可行性,推理速度比单机 offload 提升约 6 倍。
所属事件:腾讯 Sherry 量化将 Hy4 模型压缩 7 倍至 214GB(4 条相关)→
「Infra」频道最新
- AI 推理优化厂商 Wafer AI 获 4000 万美元 A 轮融资 — ycombinator · 2026-09-02
- David Manheim 算账:Hugging Face 袭击成本并非高不可攀 — davidmanheim · 2026-09-02
- RX 9070 XT 上 ComfyUI 突然变慢 3-5 倍,疑为 ROCm 驱动驱逐显存 — bosox62 · 2026-09-02
- Token 翻倍速度是 AI 的摩尔定律,作者估算 1-2 年内触及 GDP 1% — robleclerc · 2026-09-02
- Sharon Zhou:FLOPs 相对显存变便宜,算法将转向以算力换显存 — realSharonZhou · 2026-09-02
- Fleet 浏览器内 GPU 基准上线,开源数百个 WebGPU 内核 — xenovatech · 2026-09-02