NVIDIA 推出 Nemotron 音频原生开源权重模型,提供 2B 和 30B 版本
victormustar · x · 2026-07-21
NVIDIA 的 Nemotron 发布了一款 音频原生的开源权重模型,提供 2B 和 30B 两个版本。
它面向 转写、翻译、声音识别、音频问答、TTS 以及完整的语音到语音 场景,主打“直接听、直接想、直接说”,而不是把音频先粗暴转成文字再处理。
「多模态」频道最新
- HeyGen 给 coding agent 接入 7.5 万图片和 1 万音乐 — HeyGen · 2026-07-22
- Reddit 用户求 20GB 显存内的 ComfyUI 成人向工作流 — hobbyist2020 · 2026-07-22
- Krea 2 用户推荐双段 Clownshark 采样配置提升细节 — listopalafoto · 2026-07-22
- Gemini Omni Flash 把船舱直接改成了洞穴风格 — chrisfirst · 2026-07-22
- 用 Gemini、Grok 或 GPT Image 把照片转成提示词 — harshitagu72595 · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22