FireRedAudio:统一 9B 音频大模型支持一小时长音频

pmttyji · reddit · 2026-08-22

FireRedTeam 发布了 FireRedAudio,一个基于 9B 参数 LLM 的通用音频语言模型。它采用解耦连续表示设计:音频编码器负责理解,RedAE 路径负责生成。单一模型即支持 ASR、音频理解、零样本 TTS、指令 TTS、语义/声学语音编辑,并能处理长达一小时的录音,提供精确的时间定位与摘要。

同期发布的 FireRedTTS3 是基于语义增强表示的统一语音生成与编辑系统,包含 Base 版(支持 24 种语言 和 21 种中文方言的零样本克隆)和 Instruct 版(支持自然语言语音设计与编辑)。论文称其在多项评测中取得了领先的 WER/CER 和说话人相似度成绩。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →