希腊嘈杂门要1500步,英语语种识别只扛250步

Building a Production Greek-English Speech Recognizer

Christos Petrocheilos, Cleopatra Papadopoulou, Chris Porikis, Ioakeim Perros, Ayoub Kirouane, Themistoklis Nikolis

eess.AS, cs.AI, cs.SD

2026-09-12

KIEFER用1.7B双语模型和Whisper线做了23轮希腊-英语ASR。单模型过不了9道生产门,三模型ROVER投票这才凑齐9/9,重叠说话WER从53.35%降到37.87%。

这篇在解决什么

希腊大约一千一百万母语者,日常里英语会嵌进同一句,录音多半是电话和嘈杂会议室,不是录音棚。KIEFER的生产ASR(Sophea)要把希腊、英语的清洁朗读、闲聊、商务会议、嘈杂环境都压到各自的词错误率(WER)天花板以下,外加语种识别准确率≥95%,以及非语音音频零幻觉。九道门各自对应一个客户会骂的失败模式,全过才算可上线。

1.7B参数的双语模型连跑七个版本,没有一版同时过门。这不是数据量不够。

方法

两条模型线并行。紧凑线是Qwen-Audio血统的1.7B双语编码器-解码器;大模型和turbo线是Whisper家族,turbo只有四层解码器。数据过六段过滤:音频质量、每分钟词数合理性、转写置信度、多教师交叉核对、强制对齐、语言配平。一轮代表性组装是1,169,565行,成品希腊1,073,294对英语1,079,148,配平差0.55%。

音频质量用UTMOS。教材阈值3.0是给英语TTS录音棚数据的,套到希腊会扔掉98.7%的已打分音频,连干净的FLEURS希腊基准都过不了。用域内已知干净样本重标定后,阈值放到1.30,丢弃率变成10.6%。强制对齐的阈值也相对每种语言的干净锚点分布来定,不是绝对分数。

过不了九关之后,上线的是一组模型加一层路由:按预期语言和场景把通话、会议打到专用checkpoint,希腊偏重的场景强制语言解码,其余走隐式语种识别。解码期修补反复比重训便宜:静音幻觉用VAD加两条置信度阈值压到2%以下;套话过滤器去掉「ok/okay」之后,boilerplate从26条掉到0,其他指标小数点后两位不动。

集成有两条。一条是生产双语模型加Canary希腊微调加Whisper large-v3 LoRA,用ROVER混淆网络按词投票。另一条Sophea ASR K1用梯度提升分类器按整段音频二选一,只服务离线批转写。

结果

控制实验固定checkpoint,只改希腊嘈杂环境的暴露步数。WER≤25.25至少要约1500步密集暴露(1750步时从26.8到25.21)。英语LID≥95在基线配比下最多扛约250步,大约每250步掉3.5个点;重配比能扛到约1250步,但希腊WER停在约26,差自己的门大约0.75点。两个步数预算差近6倍,同时成立的工作点在测到的前沿外大约1个WER点。两次都是单次训练,没有重复种子。

真正在抢容量的是声学邻域。加835小时干净棚内英语护不住嘈杂英语;加577小时嘈杂、重叠、会议风格英语,大约三分之一的时长,同一训练步数下英语精度能站住。

紧凑线最好的C6用约230小时多引擎共识标签替换机打希腊通话标签,七关/九关,卡在会议和嘈杂。C7嘈杂最好到26.32%,仍过不了25.25。

表面自研Canary FTWhisper FT三模型投票
希腊FLEURS8.998.635.233.98
希腊嘈杂26.6322.8924.9921.56
英语会议LID99.3100.074.799.7
语码转换WER59.7442.8345.4023.84
非语音幻觉0.01.8100.01.0

单模型过4到7关,三模型投票加一条事后发现的静音抑制规则后9/9。重叠说话WER从53.35%到37.87%(相对−29%,18场会议bootstrap 95% CI 11.0–19.5个绝对点)。K1在Open ASR Leaderboard八个公开英语集平均4.26% WER,默认视图(含两个私有集)5.03、排第十一(2026-09-11);线上希腊嘈杂25.88%(n=1325,CI 24.44–27.19),是第一款单独服务就进26%门的模型。大模型同集仍是24.63%,希腊不是K1的强项。

为什么重要

给中低资源语言做生产ASR的人,这篇把「再洗一次配比」和「容量前沿」分开了。配比只沿前沿滑动。UTMOS那种外域阈值能把真数据砍掉九成,先拿域内锚点标定。三次故障(静音幻觉、语码转换、套话)都是先重训、后被解码配置解开,现在他们把解码修补写成默认先手。七项预注册后关掉的尝试也写进正文:文本纠错、带音频的二次审议、把语谱图当图让视觉模型读,全部净负。

权重和训练数据不公开,K1有公开API。

局限与存疑

不可能结论只在这套1.7B规模和训练配置上成立,更大模型或把LID拆成辅助目标有没有把前沿推开,没做。会议和嘈杂多数是内部集。Table 3和Table 4是单次点估计,差不到约1个WER点的对比论文自己说不要当真。重叠实验只有英语,Canary对AMI有预训练暴露,Sortformer重叠定位精度只有0.30到0.39,要求0.85,所以融合没进流式生产;重叠大约只占真实会议音频3.2%,就算完美检测,整场会议WER相对提升也到不了1%。ROVER和K1用的Whisper成员还是大模型线早期checkpoint,不是后来上线的L4,换L4会不会变没测。仪器自己骗过五次,包括梯度累积把loss记大32倍、课程排序把loss打跳六倍被连误诊三次。

术语

原文与代码

相关论文

全部论文解读