日语口语评测专用 ASR:莫拉标签错误率从 12.3% 降至 7.1%
tkasasagi · x · 2026-09-27
作者将在 Interspeech(悉尼)展示论文《Building Tailored Speech Recognizers for Japanese Speaking Assessment》,项目服务于日语作为第二语言的教育场景,聚焦带声调标注的音素级 ASR。
论文要点:
- 目标是输出带声调标记的音素标签,但带精确音位转写标注的训练数据稀缺。
- 提出两种缓解数据稀疏的方法:一是多任务训练,引入辅助损失估计正字法文本与音高模式,从而利用仅有正字标注的数据;二是基于有限状态转换器(FST)算法融合音素串估计器与文本 token 序列估计器。
- 实验显示多任务学习与融合均有效,在 CSJ 核心评测集上平均莫拉标签错误率从 12.3% 降至 7.1%,优于通用多语种识别器。
「多模态」频道最新
- 开发者实测:AI 做歌流程是歌词-Suno-人工筛选-Ableton 录制 — ctjlewis · 2026-09-27
- 6M tokens 成本 $65,Opus 5.5 端到端生成音乐视频已"不稀奇" — rickasaurus · 2026-09-27
- 一条 prompt 生成奇点主题视频essay,Runway CEO 演示全流程 — c_valenzuelab · 2026-09-27
- Claude 5.5 包办词曲与视频,AI 生成完整歌曲《Ctrl + Z》 — BidAdministrative251 · 2026-09-27
- 8GB 显存 5060 本地跑 Qwen 图像生成,网友称效果惊人 — tryku2 · 2026-09-27
- 想拍软件质量讲解视频,结果全用 AI 做成了 MV — EricBuess · 2026-09-27