NVIDIA 推出 Nemotron 音频原生开源权重模型,提供 2B 和 30B 版本

victormustar · x · 2026-07-21

NVIDIA 的 Nemotron 发布了一款 音频原生的开源权重模型,提供 2B 和 30B 两个版本。

它面向 转写、翻译、声音识别、音频问答、TTS 以及完整的语音到语音 场景,主打“直接听、直接想、直接说”,而不是把音频先粗暴转成文字再处理。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →