FireRedAudio 开源:9B 单模型听懂、推理、说话、编辑音频
aigclink · x · 2026-08-31
FireRedAudio 是小红书 FireRedTeam 开源的通用音频语言模型,基于共享的 9B 参数 LLM 主干,采用解耦的连续表示:Audio Encoder 通路负责理解,RedAE-Patch 通路负责语音生成,据称是首个公开的此类设计。
一个模型覆盖 ASR、音频理解、零样本 TTS、指令 TTS、语义/声学语音编辑,并支持对最长一小时录音的精确时间定位。官方 PyTorch 代码已在 GitHub 开源(FireRedTeam/FireRedAudio)。
所属事件:小红书开源 9B 通用音频语言模型 FireRedAudio(2 条相关)→
「多模态」频道最新
- Runway 生成 15 秒纯黑白片头完整 Prompt — umesh_ai · 2026-09-01
- DreamX-Creator:7B 模型原生生成 2K 音视频 — GD-ML · 2026-09-01
- 如何生成含不同口音的多角色对话视频? — delveccio · 2026-09-01
- 多模态生成技巧:先用 Gemini 起草再用 Sol 修正 — A_K_Nain · 2026-09-01
- 日式体育挑战:30 秒实拍级视频生成 — SimplyAnnisa · 2026-09-01
- Seedance 2.5 升级:提升 AI 虚拟网红视频的一致性与故事性 — aftahi_ai · 2026-09-01