小红书开源 9B 统一音频语言模型 FireRedAudio

aigclink · x · 2026-08-31

小红书 FireRedTeam 开源 FireRedAudio,一个共享 9B LLM 主干的通用音频语言模型:音频编码器负责理解,RedAE 通路负责生成,理解与生成解耦但共用同一个「大脑」。

单一模型即可支持 ASR、音频理解、零样本 TTS、指令 TTS、语义/声学语音编辑,以及对长达一小时录音的精确时间定位。实测效果包括:一小时播客可整理出带时间戳的专业节目稿,支持声音克隆、按一句话设计新声音、编辑音频内容,输出有分镜感、叙事节奏、情绪标注与时间导航,接近手动整理访谈素材的水平。

所属事件:小红书开源 9B 通用音频语言模型 FireRedAudio(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →