阿里再开两源补齐语音增强拼图:线性注意力提速 2 倍、回声消除仅 22ms 延迟
aigclink · x · 2026-09-10
阿里新开源两个 AI 语音增强模型,凑齐覆盖「背景噪声、回声、多人抢话」的 7 模型体系:
- FLASepformer(语音分离):传统分离计算量随音频长度平方级暴涨,它用线性注意力将复杂度改为线性,速度快 1.5-2.3 倍,显存只需原来的 16%-32%。
- JAEC 16K(可解释回声消除):把「估延迟→算回声并抵消」两步做成可观察的,调试通话质量能看到每步做了什么;延迟仅 22 毫秒,实时通话够用;但目前只支持线性回声,不支持喇叭破音等非线性失真。
连同此前的 ZipEnhancer 16k 降噪、DFSMN ANS 48k 实时降噪、FRCRN 16k 复杂噪声增强、MossFormer2 8k 语音分离、DFSMN AEC 16k 实时回声消除,作者给出按场景选型建议:语音助手用降噪组合,实时通话用 JAEC+降噪,多人会议/访谈用分离+VAD/ASR。
所属事件:阿里开源两款语音增强模型,凑齐七模型体系(2 条相关)→
「多模态」频道最新
- 用 NTSB 新公开影像 3D 重建亚马逊 Prime Air 迈阿密坠机现场 — bilawalsidhu · 2026-09-10
- 用 NTSB 新 footage 重建迈阿密 Prime Air 坠机现场 3D — bilawalsidhu · 2026-09-10
- OpenAI 官方案例:一句话用 GPT-6 Astra 在 Blender 建房再搬进 UE5 漫游 — xiaohu · 2026-09-10
- OpenAI 演示 Astra 驱动 Blender:一句话生成可编辑 3D 建筑场景 — xiaohu · 2026-09-10
- GPT-6 Astra 案例:一句提示词完成住宅 3D 建模与 UE5 实时交互 — xiaohu · 2026-09-10
- 量子位实测 VivagoR1:主打确定性交付的 AI 视频 Agent 一次直出 — 量子位 · 2026-09-10