翻译走 Flow Matching、检索走对比学习,这套按任务分流的方法在 Indic MTEB 创 SOTA

Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation

Tirth Bhatt, Naren Kumar S, Mayank Singh

cs.CL, cs.AI

2026-08-06

按任务分流训练目标:翻译用 Flow Matching、检索与分类用对口的对比与 margin 目标,加三阶段课程,在 22 语言 Indic MTEB 上把多个嵌入模型提升 1.6~4.4 分刷新 SOTA。

这篇在解决什么

多语言文本嵌入模型(text embedding)在适配下游任务时,惯常做法是用一个对比学习目标(contrastive learning)训所有任务:检索、分类、句对判别、翻译、聚类、语义相似度,全部一锅炖。问题是这些任务的优化动态根本不一样,单一目标会给出互相打架的信号。而且对比学习有个老毛病叫假负例(false negative),把语义相近的句子硬推开,把原本连续的嵌入空间切碎。

这篇来自 IIT Gandhinagar 的论文盯的是印度语言。印地语之外的 21 种法定语言(scheduled languages)长期欠服务,缺高质量多语言嵌入。作者要解决的是:低资源语言上,怎么给嵌入适配找到不互相冲突的训练信号。

方法

核心想法很直白:不同任务配不同的训练目标。TCFM 把训练数据分成四类任务族,按类路由。

Flow Matching 的具体做法是:在源表示 zs 和目标表示 ztgt 之间线性插值出中间态 z(t),让一个小网络去预测这条路径的方向,损失是预测速度和教师引导的目标方向之间的余弦距离。教师引导体现在目标方向里,混入了教师模型对源和目标的表示差。

训练按三阶段课程走。第一阶段只做翻译式的跨语言对齐(flow 加教师);第二阶段加入分类和自然语言推理数据,同时保留约 4 万对翻译样本做回放防止遗忘;第三阶段加入检索,并用 SimCSE 式的单语一致性正则保住单语表示。

一个关键设计选择:Flow Matching 只用在翻译任务上。消融显示,把它推广到所有任务反而略差(提升 1.63 对 1.67)。作者的假设是,翻译有干净的一一对应,flow matching 能利用这种对应,别的任务没有。

结果

在 22 种语言的 Indic MTEB(印度语言版海量文本嵌入基准)v3 上评测,跨五个嵌入模型家族,全部提升,刷新 SOTA。

模型基线TCFM提升
Harrier-0.6B65.8769.46+3.59
Qwen3-Embedding-8B72.8974.87+1.97
Harrier-270M63.9468.33+4.40
EmbeddingGemma-300M64.3466.68+2.34
Qwen-Embedding-4B70.9472.59+1.65

最大的单项涨幅在聚类:Harrier-0.6B 上从 29.09 冲到 50.12,涨了 21 分。消融验证了每个组件都在干活:把教师保持去掉、只留 flow 加对比,检索掉 12.48 分、语义相似度掉 8.99 分,说明教师保持对这两个任务贡献最大。课程分阶段也确实在累加收益,但路径不平滑,Qwen3-8B 的聚类在第二阶段还会回落 2.6 分,到第三阶段才暴涨 15 分。

为什么重要

这是一个不改架构、从小模型(300M)到大模型(8B)都有效的低资源语言嵌入适配配方。对做非英语检索或 RAG 的人来说,可以直接拿来用,尤其那些主流嵌入模型表现一般的语种。

更大的价值是那个可迁移的洞见:一个目标适配不了所有任务。翻译、检索、分类对表示空间的要求不同,硬用一个对比目标会让它们互相拖累。flow matching 只对翻译有效的结论,是个具体、可证伪的设计经验,不限于印度语言。

局限与存疑

评测只覆盖 22 种印度语言(Indic MTEB),换到其他语系能不能泛化,论文没碰。方法依赖高质量平行翻译语料,真正零资源的语言用不了。

flow matching 改善嵌入空间均匀性的说法只有经验证据,作者自己承认缺一个形式化的几何分析,也没探索在 flow matching 里加一个显式排斥力正则。代价不低:要冻结一个教师模型、多一个速度预测网络、再跑三阶段课程。

结果也不是全胜。Qwen3-8B 上检索微降 0.28 分,不是干净的全线提升。聚类的大涨也很敏感:第二阶段回落、第三阶段暴涨,说明这个指标对表示几何高度敏感,方法对它并没有完全可控。

术语

原文与代码

相关论文

全部论文解读