腾讯 1.5TB 模型压至 200GB,精度几乎无损
ChrisGPT · x · 2026-08-29
腾讯宣布将 Hy4-preview 模型从 1.5TB 压缩至约 200GB GGUF 格式,且精度损失极小。该 MIX-STQ10 方法的核心在于利用校准数据为每一层动态决定位宽:部分层被激进压缩至 1.31-bit,而敏感层则保持在 2-bit 左右。
- MCP Atlas: 83.7 → 83.2
- SWE-Bench Multi: 82.9 → 81.3
- MRCR: 81.3 → 81.1
- IFBench: 73.5 → 72.5
这种非均匀量化的策略在相同算力预算下显著降低了误差,展示了低比特推理的惊人效率。
所属事件:腾讯将 1.5TB 模型压缩至 200GB 且精度几乎无损(2 条相关)→
「Infra」频道最新
- pMLX 优化 Qwen 与 GLM 模型:专家换页技术实现 37GB 内存运行 — EyalToledano · 2026-08-29
- Kubernetes 与 TensorFlow Serving 部署模型实战 — Al_Grigor · 2026-08-29
- 无服务器深度学习:在 AWS Lambda 上部署模型 — Al_Grigor · 2026-08-29
- 模型部署实战:FastAPI 与 Docker 云端部署 — Al_Grigor · 2026-08-29
- Firefox 与 Chrome 计划支持 JPEG XL 图像格式 — addyosmani · 2026-08-29
- 澳媒称澳处“分岔路口”,欲借数据中心争取算力红利 — TobyWalsh · 2026-08-29