英伟达提出统一音频-文本大模型

nvidia · hf · 2026-07-07

英伟达提出一种统一音频-文本大语言模型,通过共享transformer解码器整合音频与文本处理,在多项音频、语音任务上取得更优表现,同时保持较强的文本推理能力,实现“音频智能而不牺牲文本智能”。

所属事件:英伟达发布开源音频文本大模型 Audex-30B(9 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →