英伟达发布开源音频文本大模型 Audex-30B
英伟达正式发布了开源的统一音频-文本大模型 Nemotron-Labs-Audex-30B-A3B(简称 Audex)。该模型旨在通过单一架构同时处理音频与文本,解决传统音频模型在多模态融合中的智能瓶颈,标志着多模态AI领域的重要进展。
架构与核心能力
Audex 采用混合专家架构,总参数量为 30B,但每次推理仅激活 3B 参数。模型通过共享 transformer 解码器,将音频输入投影到文本嵌入空间中,从而整合音频与文本处理。这种设计使其能够一体化支持音频理解、语音识别与翻译、文本转语音、音频生成以及语音到语音生成等全栈任务,并支持 SFT 和 RL 训练。
性能表现与业界反响
英伟达强调,Audex 实现了“音频智能而不牺牲文本智能”。在多项音频智能基准测试上,它达到了开源模型的最佳水平;同时在数学、代码推理、对齐和指令遵循等任务上,其表现甚至超过了纯文本模型。独立开发者 @andrewncarr 评价道,许多音频模型往往缺乏常识,但 Audex 展现出了更强的理解能力,可能是首个“不那么笨”的原生音频模型。
2026-07-07 ~ 2026-07-09 · 9 条相关
一手来源
- 英伟达发布 Nemotron-Audex-30B:统一音频-文本大模型 — pmttyji ·
- Audex开源音频-文本大模型,多模态能力领先 — _weiping ·
- 英伟达发布Audex-30B-A3B音频语言模型 — nvidia · 2026-07-07
- 【源头】英伟达发布 Nemotron-Audex-30B:统一音频-文本大模型 — pmttyji · 2026-07-07
- 英伟达提出统一音频-文本大模型 — nvidia · 2026-07-07
- NVIDIA发布Audex:统一音频-文本MoE模型 — ctnzr · 2026-07-07
- 【源头】Audex开源音频-文本大模型,多模态能力领先 — _weiping · 2026-07-08
- NVIDIA研究员正式发布Audex音频语言模型 — _weiping · 2026-07-08
- Nvidia发布原生音频模型 — andrew_n_carr · 2026-07-09