小红书开源 9B 统一音频语言模型 FireRedAudio
aigclink · x · 2026-08-31
小红书 FireRedTeam 开源 FireRedAudio,一个共享 9B LLM 主干的通用音频语言模型:音频编码器负责理解,RedAE 通路负责生成,理解与生成解耦但共用同一个「大脑」。
单一模型即可支持 ASR、音频理解、零样本 TTS、指令 TTS、语义/声学语音编辑,以及对长达一小时录音的精确时间定位。实测效果包括:一小时播客可整理出带时间戳的专业节目稿,支持声音克隆、按一句话设计新声音、编辑音频内容,输出有分镜感、叙事节奏、情绪标注与时间导航,接近手动整理访谈素材的水平。
所属事件:小红书开源 9B 通用音频语言模型 FireRedAudio(2 条相关)→
「多模态」频道最新
- 日式体育挑战:30 秒实拍级视频生成 — SimplyAnnisa · 2026-09-01
- Seedance 2.5 升级:提升 AI 虚拟网红视频的一致性与故事性 — aftahi_ai · 2026-09-01
- 利用 Krea.ai 生成恶魔罗刹角色视频 — CurieuxExplorer · 2026-09-01
- AI 情景喜剧已能连追四集,《Bad Cat》成最新标杆 — venturetwins · 2026-09-01
- Spatial Studio 支持高斯泼溅动画与 4K 导出 — Scobleizer · 2026-09-01
- Breeze-TTS-2 模型 Demo 上线 Hugging Face — BreezeBlue · 2026-09-01