132 万条混码对话开源,IndicTalk 补上印度 9 语种对话数据缺口

IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

Sahil Deepak Gawande, Mayank Singh

cs.CL, cs.LG

2026-07-25

印地语、泰米尔语等印度语种的混码(code-mix)对话数据长期稀缺;IndicTalk 用「新闻摘要 + 人设 + 多语 LLM 生成 + 自动校验」的全自动管线,造出 132 万条覆盖 9 个印度语种、原生文字与罗马拼音两种写法的多轮对话。

这篇在解决什么

印度双语使用者有个很自然的习惯:在同一段对话里来回切换英语和母语,母语既可能用原生文字写,也可能用罗马拼音写,这种混杂叫 code-mixing(语码转换)。但能用来训练对话模型的这类数据几乎没有。现有的印度语种 NLP 数据集大多是情感分析、仇恨言论检测这类判别任务,对话资源极少,而且基本只覆盖 Hinglish(印英混杂),规模也小。这成了多语对话 LLM 训练和评测的瓶颈。

IndicTalk 要补的就是这块:一个大规模、事件为锚、多轮、覆盖多种印度语种和两种书写系统的混码对话语料。

方法

整条管线全自动,分几步:

先把原始新闻和博客文档喂给 Sarvam-M 做摘要。直接拿长文档生成对话会让 LLM 偏向又长又啰嗦,所以先转成「语言无关的语义表示」来归一化输入。Sarvam-M 是在一轮盲测 arena 评比里选出来的(Elo 1861,高于 Llama 7B 的 1582 和 Gemma 7B 的 1056)。

接着给每段对话配一对人设。五种人设类别:朋友、家人、同事、专家、师生,人设在整段对话里固定,保证上下文一致。

然后用多语 LLM(GPT-OSS-120B,开发中比 Qwen2.5-72B、Gemma 4-31B 等更稳地通过下游校验)为每个语种生成对话,每个印度语种各出两版:原生文字版(母语用原生文字、英语用罗马字)和罗马拼音版(两种语言都用罗马字)。每条对话 6-8 轮。

最后是自动校验:原生文字版要求每句都至少含一个目标语种 token 和一个罗马字 token、且达到最低语码混杂指数(CMI)、不少于最小长度;罗马拼音版因为两种语言同用罗马字,词级语言识别不可靠,跳过 CMI,质量靠人工评把关。

结果

语料规模:从约 14.2 万篇新闻和博客(12 个领域)生成 132 万多条对话,9 个印度语种乘 2 种书写系统得到 18 个语种变体,共 1069 万轮,平均每条 7.55 轮。生成用了 16 块 H200、约 1 万 GPU 小时。

语码混杂的量化指标符合预期:原生文字版平均 CMI 37.81、切换点比例(SPF)0.438、M-index 0.865,说明两种语言频繁切换且大体均衡;泰卢固语和卡纳达语混杂最强。原生文字版的伪困惑度(PPPL)在 9.14-18.52,说明尽管频繁切换,句子仍流畅。

指标原生文字版罗马拼音版
平均 CMI37.8120.23
平均 SPF0.4380.311
平均 M-index0.8650.508
伪困惑度(平均)13.58不报告

质量上,两个判官模型(Gemini-2.5-Flash 与 GPT-OSS-120B,各评 500 条每语种,共 9000 条)给大部分语种的总体质量打分在 4.0 以上(5 分制),两者排名高度相关(ρ=0.91)。人工评(每语种 10 条,共 180 条)里,原生文字版略高于罗马拼音版,马拉地语和卡纳达语在原生文字版得分最高,印地语在罗马拼音版最高;但人工排名和 LLM 判官只有中等相关(ρ=0.469-0.559)。

为什么重要

对做低资源语种对话系统的团队,这是个直接能拿来训练和评测的语料,而且把「事件为锚 + 人设 + 自动校验」这条全自动管线写清楚了,可复用到别的语族。需要指出的是,这类合成语料的价值天花板取决于下游任务,论文本身没有给出在某个基准上的端到端提升,主要论证的是数据质量达标。

局限与存疑

作者承认得很直接:这终究是合成语料,可能抓不全真实双语对话里的语用细节、方言差异和口语不流畅;来源以新闻和博客为主,语料偏向正式、事件性话语;人工评每语种只有 2-3 个研究生标注员,不一定代表方言和罗马化的多样性;伪困惑度只对原生文字版报告,罗马化文本不可比。

读下来一个隐忧:生成和评判都重度依赖 GPT-OSS-120B,虽然用了 Gemini 做独立判官来对冲自偏好,但「同款模型既造数据又评数据」的结构性偏差没法完全排除;而人工与 LLM 判官只有中等相关,也提示 LLM 的高分未必等于人类觉得自然。

术语

原文与代码

相关论文

全部论文解读