Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation
Tirth Bhatt, Naren Kumar S, Mayank Singh
cs.CL, cs.AI
2026-08-06
按任务分流训练目标:翻译用 Flow Matching、检索与分类用对口的对比与 margin 目标,加三阶段课程,在 22 语言 Indic MTEB 上把多个嵌入模型提升 1.6~4.4 分刷新 SOTA。
多语言文本嵌入模型(text embedding)在适配下游任务时,惯常做法是用一个对比学习目标(contrastive learning)训所有任务:检索、分类、句对判别、翻译、聚类、语义相似度,全部一锅炖。问题是这些任务的优化动态根本不一样,单一目标会给出互相打架的信号。而且对比学习有个老毛病叫假负例(false negative),把语义相近的句子硬推开,把原本连续的嵌入空间切碎。
这篇来自 IIT Gandhinagar 的论文盯的是印度语言。印地语之外的 21 种法定语言(scheduled languages)长期欠服务,缺高质量多语言嵌入。作者要解决的是:低资源语言上,怎么给嵌入适配找到不互相冲突的训练信号。
核心想法很直白:不同任务配不同的训练目标。TCFM 把训练数据分成四类任务族,按类路由。
Flow Matching 的具体做法是:在源表示 zs 和目标表示 ztgt 之间线性插值出中间态 z(t),让一个小网络去预测这条路径的方向,损失是预测速度和教师引导的目标方向之间的余弦距离。教师引导体现在目标方向里,混入了教师模型对源和目标的表示差。
训练按三阶段课程走。第一阶段只做翻译式的跨语言对齐(flow 加教师);第二阶段加入分类和自然语言推理数据,同时保留约 4 万对翻译样本做回放防止遗忘;第三阶段加入检索,并用 SimCSE 式的单语一致性正则保住单语表示。
一个关键设计选择:Flow Matching 只用在翻译任务上。消融显示,把它推广到所有任务反而略差(提升 1.63 对 1.67)。作者的假设是,翻译有干净的一一对应,flow matching 能利用这种对应,别的任务没有。
在 22 种语言的 Indic MTEB(印度语言版海量文本嵌入基准)v3 上评测,跨五个嵌入模型家族,全部提升,刷新 SOTA。
| 模型 | 基线 | TCFM | 提升 |
| Harrier-0.6B | 65.87 | 69.46 | +3.59 |
| Qwen3-Embedding-8B | 72.89 | 74.87 | +1.97 |
| Harrier-270M | 63.94 | 68.33 | +4.40 |
| EmbeddingGemma-300M | 64.34 | 66.68 | +2.34 |
| Qwen-Embedding-4B | 70.94 | 72.59 | +1.65 |
最大的单项涨幅在聚类:Harrier-0.6B 上从 29.09 冲到 50.12,涨了 21 分。消融验证了每个组件都在干活:把教师保持去掉、只留 flow 加对比,检索掉 12.48 分、语义相似度掉 8.99 分,说明教师保持对这两个任务贡献最大。课程分阶段也确实在累加收益,但路径不平滑,Qwen3-8B 的聚类在第二阶段还会回落 2.6 分,到第三阶段才暴涨 15 分。
这是一个不改架构、从小模型(300M)到大模型(8B)都有效的低资源语言嵌入适配配方。对做非英语检索或 RAG 的人来说,可以直接拿来用,尤其那些主流嵌入模型表现一般的语种。
更大的价值是那个可迁移的洞见:一个目标适配不了所有任务。翻译、检索、分类对表示空间的要求不同,硬用一个对比目标会让它们互相拖累。flow matching 只对翻译有效的结论,是个具体、可证伪的设计经验,不限于印度语言。
评测只覆盖 22 种印度语言(Indic MTEB),换到其他语系能不能泛化,论文没碰。方法依赖高质量平行翻译语料,真正零资源的语言用不了。
flow matching 改善嵌入空间均匀性的说法只有经验证据,作者自己承认缺一个形式化的几何分析,也没探索在 flow matching 里加一个显式排斥力正则。代价不低:要冻结一个教师模型、多一个速度预测网络、再跑三阶段课程。
结果也不是全胜。Qwen3-8B 上检索微降 0.28 分,不是干净的全线提升。聚类的大涨也很敏感:第二阶段回落、第三阶段暴涨,说明这个指标对表示几何高度敏感,方法对它并没有完全可控。