英伟达发布Nemotron 3.5 ASR模型,极速低延迟但医疗术语易漏

英伟达在Hugging Face发布了参数量为0.6B的流式多语言语音识别模型Nemotron 3.5 ASR。开发者在Nvidia A10上使用合成医疗出院指令进行了实测,发现该模型响应速度极快,首文本生成仅需1.1秒,最终延迟低至40毫秒。然而,测试也暴露出该模型在医疗场景下的局限性,它容易出错并漏抓关键的药名信息。

2026-08-07 ~ 2026-08-07 · 3 条相关

另有 1 条近重复转述:MaziyarPanahi