阿里开源两个语音增强模型:线性注意力提速 1.5~2.3 倍,回声消除延迟仅 22ms
aigclink · x · 2026-09-10
阿里最新开源两个 AI 语音增强模型,补齐背景噪声、回声、多人抢话三类真实语音问题的系统化方案,至此共 7 个开源语音增强模型:
- FLASepformer(高效语音分离):解决多人抢话。传统语音分离计算量随音频长度平方级暴涨,它用线性注意力把复杂度降到线性,速度提升 1.52.3 倍,显存只需原来的 16%32%。
- JAEC 16K(可解释回声消除):传统回声消除是黑盒,它把内部两步(估计延迟、计算并抵消回声)做成可观察,调试通话质量时能看到每步做了什么;延迟仅 22 毫秒,满足实时通话。目前只处理线性回声,不支持喇叭破音等非线性失真。
开源了 FLASepformer 与 JAEC 16K 两个模型的权重。
所属事件:阿里开源两款语音增强模型,凑齐七模型体系(2 条相关)→
「模型」频道最新
- 谷歌发布 Gemini 3.8 Flash Cyber 网络安全模型,自动挖洞并生成补丁 — OfficialLoganK · 2026-09-10
- Mira Murati同事质疑:为何不能付费让不安全模型帮你渗透测试 — DavidSHolz · 2026-09-10
- 网友从 OpenAI Navier-Stokes 图表反推:或已解约 91 个未公开难题 — teortaxesTex · 2026-09-10
- 年付 2 万欧客户控诉 Claude 变弱,疑 Anthropic 后台省算力 — maier_ak · 2026-09-10
- 用户称年付 2 万欧元用 Claude,却感觉模型越来越弱 — maier_ak · 2026-09-10
- AI 助手 Astra 说话常漏空格?用户:多发生在数字场景 — gandamu_ml · 2026-09-10