混元发布Hy-MT2:7B快思考翻译超过DeepSeek-V4-Pro,1.8B量化后仅440MB

Hy-MT2: A Family of Fast, Efficient and Powerful Multilingual Translation Models in the Wild

Mao Zheng, Zheng Li, Tao Chen, Bo Lv, Mingrui Sun, Mingyang Song, Jinlong Song, Hong Huang, Decheng Wu, Hai Wang, Yifan Song, Yanfeng Chen, Guanwei Zhang

cs.CL

2026-05-21

混元Hy-MT2家族覆盖三十三种语言,提供1.8B、7B与30B-A3B。7B在FLORES全向XCOMET达到86.89,约合Gemini思考模式的98%;1.8B总体强过微软与豆包接口,1.25bit大约440MB。

这篇在解决什么

Hy-MT1.5发出去之后,业务侧的抱怨很集中:金融法律医学术语不稳,网页、会议、社交文本形态太杂,用户还会加「这个词别译」「按这个模板出」之类约束,模型经常当没看见。7B跟Gemini、GPT仍有缝,端侧4bit还要超过1GB,延迟也不够。Hy-MT2冲这几件事来:领域、野外文本、翻译指令、把规模拉到MoE 30B-A3B,以及把1.8B压到能塞进手机的体积。

覆盖33种语言,三档:1.8B、7B、30B-A3B(激活约3B)。定位是快思考翻译,不是慢慢想的通用大模型。

方法

先从混元预训练模型做约1T token的翻译向中训,单语加平行语料,场景覆盖通用、领域、野外和指令。

后训练不把所有语系搅在一锅,按语系分支出Family-Centric Post-training。每条支路先做Reference-Guided On Policy Distillation:用多个混元参考模型和数据集标签拼成Chimera Teacher,学生在线采样,前向KL去贴融合偏好。再在该语系上跑GRPO。奖励不是打一个总分,先用规则挡住严重重复和语码混杂(直接给0),过关的用LLM按MQM五维扣分:术语、准确性、语言规范、风格、指令遵循。满分100,致命错误直接0,再扣长度惩罚,避免短译刷分。

最后做跨语系On Policy Distillation,把各语系强教师和通用指令教师倒进一个学生,这里改用反向KL,并掺通用指令数据,免得模型只会翻译。

量化档位从FP16、8bit、4bit到2bit、1.25bit。8/4bit主要PTQ;2bit用AngelSlim的SEQ QAT;1.25bit用Sherry的3:4稀疏三值。超低bit的学生还要同时吃语言模型损失和正反向KL,权重按教师token置信度动态调。

结果

FLORES-200全向XCOMET:Hy-MT2-1.8B/7B/30B-A3B为79.77/86.89/87.47,分别相当于Gemini 3.1 Pro思考模式88.74的89.9%、97.9%、98.6%。7B和30B超过DeepSeek-V4-Pro非思考(83.29)和Kimi K2.6非思考(84.05)。相对Hy-MT1.5-7B的80.98,7B这一档跳了将近6分。

WMT25上7B拿到63.86/71.21/82.24,高于1.5的61.59/68.85/75.91;30B-A3B的GEMBA 84.34,表上高于Gemini思考模式的82.23。普通话与少数民族互译,7B的XCOMET 62.05,略高于Gemini的61.11。

模型FLORES全向XCOMETWMT25 XCOMET对照
Hy-MT2-1.8B79.7750.30MT1.5-1.8B 78.40 / 53.08
Hy-MT2-7B86.8963.86MT1.5-7B 80.98 / 61.59
Hy-MT2-30B-A3B87.4762.89Gemini 3.1 ProT 88.74 / 57.58

领域集DomainMTBench平均,30B-A3B为95.04/93.73,XCOMET是表上最高;野外集WildMTBench上7B为90.28/88.93,30B的GEMBA 89.25超过Gemini的88.96。翻译指令集IFMTBench,7B总分83.14,30B 84.69。通用指令并不突出:30B的Multi-IF后几轮弱于同规模开源模型。

1.8B相对微软和豆包,在中英方向、WMT25和野外集上总体更好;FLORES全向XCOMET 79.77略低于微软的80.13。WMT25的XCOMET从1.5的53.08掉到50.30,小模型这一档不是全面上涨。量化表里1.8B-2bit的FLORES全向从BF16的79.21降到76.31,IFMTBench从69.36降到58.99。摘要声称的1.25bit、440MB、相对4bit在Apple A15上快1.5倍,量化主表没有给出1.25bit的质量数字。

为什么重要

专门翻译模型在通用大模型碾压的年份里还活着,靠的是体积、延迟和「按用户规矩译」。7B快思考就能贴上Gemini思考模式的FLORES,部署成本差一个数量级。1.8B对商业API的优势对端侧和内网场景有用,前提是接受它在WMT25上相对1.5的回退,以及2bit后指令遵循掉一截。

语系分支出教师再蒸馏,是在用训练配方换「所有语言一锅炖」的互相干扰。有用,也更贵。

局限与存疑

没有独立Limitations节。DomainMTBench、WildMTBench、IFMTBench都是自建,标注和划分细节不够透明,GEMBA又是LLM打分,跟自家模型同源时容易偏袒流畅度。对照里大量带T的思考模式分数,Hy-MT2自己是快思考,直接比「思考后的Gemini」有广告效果,口径要分开看。1.25bit的440MB只出现在摘要和部署叙述,主实验表停在2bit。30B是MoE,激活3B,跟稠密30B比不公平,跟A3B级对照才公平。通用多轮指令仍弱,当聊天模型用会露怯。

术语

原文与代码

社区讨论

相关论文

全部论文解读