腾讯混元 1.25-bit 模型落地 B 站直播翻译
腾讯混元 · wechat · 2026-08-26
腾讯混元发布针对端侧翻译模型 Hy-MT2-1.8B 的极致量化方案,成功将 3.3GB 模型压缩至 440MB(1.25-bit)或 574MB(2-bit),且翻译质量几乎无损。
技术方案:
- 2-bit 模型:采用拉伸弹性量化(SEQ)与量化感知蒸馏(QAD),面向中高端设备。
- 1.25-bit 模型:基于自研 Sherry 技术(ACL 2026 Oral),利用细粒度稀疏策略,面向全系设备,配合 STQ 内核适配 SIMD 指令集。
落地与优化:
- 英特尔合作:优化 x86 平台算子,VNNI 指令融合使推理速度提升 2.75 倍。
- B 站实测:已接入直播弹幕实时翻译,单条耗时 500800ms,内存占用 500700MB,数据不出端侧保障隐私。
「Infra」频道最新
- Jalapeno 芯片表现强劲,揭示 Nvidia 架构推理劣势 — beffjezos · 2026-08-26
- NVIDIA 宣称 Rubin 架构 Agent 吞吐量提升 30 倍 — Crescitaly · 2026-08-26
- 澳大利亚总理让步:AI 数据中心不再强制全用绿电供电 — nordicinst · 2026-08-26
- 单卡 RTX 5090 实测:27B 模型 616 tok/s 跑通 262K 上下文 — EAccelerate_42 · 2026-08-26
- 16GB显存跑27B:OpenCode+Qwen3.8本地编码完整配置教程 — Due-Project-7507 · 2026-08-26
- Homelab 搭建:5060 Ti 与 RX 9070 怎么选? — MrCatberry · 2026-08-26