FireRedAudio:统一 9B 音频大模型支持一小时长音频
pmttyji · reddit · 2026-08-22
FireRedTeam 发布了 FireRedAudio,一个基于 9B 参数 LLM 的通用音频语言模型。它采用解耦连续表示设计:音频编码器负责理解,RedAE 路径负责生成。单一模型即支持 ASR、音频理解、零样本 TTS、指令 TTS、语义/声学语音编辑,并能处理长达一小时的录音,提供精确的时间定位与摘要。
同期发布的 FireRedTTS3 是基于语义增强表示的统一语音生成与编辑系统,包含 Base 版(支持 24 种语言 和 21 种中文方言的零样本克隆)和 Instruct 版(支持自然语言语音设计与编辑)。论文称其在多项评测中取得了领先的 WER/CER 和说话人相似度成绩。
「多模态」频道最新
- MiniMax-H3 视频修复移植 diffusers 模块化管线,6 步换主体 — linoy_tsaban · 2026-08-22
- PixVerse 赠送 600 万积分,支持免费 AI 视频生成 — aziz4ai · 2026-08-22
- 用 Seedance 生成 9 分钟超级英雄 AI 短片 — Uerwol · 2026-08-22
- 社区热议:FLUX 3 是否会开源权重? — East_Shoe8814 · 2026-08-22
- 实测 Gemini Omni 视频生视频:SketchUp 渲染前即可预览 — aziz4ai · 2026-08-22
- 3D 生成工具 Plamo 公测:意图与执行间无需手动建模 — Scobleizer · 2026-08-22