英伟达发布开源音频文本大模型 Audex-30B

英伟达正式发布了开源的统一音频-文本大模型 Nemotron-Labs-Audex-30B-A3B(简称 Audex)。该模型旨在通过单一架构同时处理音频与文本,解决传统音频模型在多模态融合中的智能瓶颈,标志着多模态AI领域的重要进展。

架构与核心能力

Audex 采用混合专家架构,总参数量为 30B,但每次推理仅激活 3B 参数。模型通过共享 transformer 解码器,将音频输入投影到文本嵌入空间中,从而整合音频与文本处理。这种设计使其能够一体化支持音频理解、语音识别与翻译、文本转语音、音频生成以及语音到语音生成等全栈任务,并支持 SFT 和 RL 训练。

性能表现与业界反响

英伟达强调,Audex 实现了“音频智能而不牺牲文本智能”。在多项音频智能基准测试上,它达到了开源模型的最佳水平;同时在数学、代码推理、对齐和指令遵循等任务上,其表现甚至超过了纯文本模型。独立开发者 @andrewncarr 评价道,许多音频模型往往缺乏常识,但 Audex 展现出了更强的理解能力,可能是首个“不那么笨”的原生音频模型。

2026-07-07 ~ 2026-07-09 · 9 条相关

一手来源

另有 2 条近重复转述:_weiping · _weiping