FireRedAudio 开源:9B 单模型听懂、推理、说话、编辑音频

aigclink · x · 2026-08-31

FireRedAudio 是小红书 FireRedTeam 开源的通用音频语言模型,基于共享的 9B 参数 LLM 主干,采用解耦的连续表示:Audio Encoder 通路负责理解,RedAE-Patch 通路负责语音生成,据称是首个公开的此类设计。

一个模型覆盖 ASR、音频理解、零样本 TTS、指令 TTS、语义/声学语音编辑,并支持对最长一小时录音的精确时间定位。官方 PyTorch 代码已在 GitHub 开源(FireRedTeam/FireRedAudio)。

所属事件:小红书开源 9B 通用音频语言模型 FireRedAudio(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →