英伟达提出统一音频-文本大模型
nvidia · hf · 2026-07-07
英伟达提出一种统一音频-文本大语言模型,通过共享transformer解码器整合音频与文本处理,在多项音频、语音任务上取得更优表现,同时保持较强的文本推理能力,实现“音频智能而不牺牲文本智能”。
所属事件:英伟达发布开源音频文本大模型 Audex-30B(9 条相关)→
「多模态」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 零编程经验者用 ChatGPT 开发 ComfyUI 安卓客户端将上架 — ComfierUI · 2026-09-11
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11