微软开源 VibeVoice-ASR-Streaming-7B 流式语音识别模型
Acceptable-Cycle4645 · reddit · 2026-09-03
微软在 Hugging Face 上发布了 VibeVoice-ASR-Streaming-7B,一个支持流式输入的语音识别(ASR)模型,权重已开放下载。作为 VibeVoice 系列的 ASR 版本,它面向实时语音转写场景,7B 参数规模在开源 ASR 模型中体量较大,适合需要低延迟流式识别的开发者关注。
所属事件:微软开源流式语音识别模型 VibeVoice-ASR-Streaming-7B(2 条相关)→
「多模态」频道最新
- MiniMax H3 单图细节糊?ComfyUI 工作流求优化方案 — Ok-Brain-5729 · 2026-09-03
- 港中深开源 SolarWM:统一训练配方构建长时程视频世界模型 — CUHKSZ · 2026-09-03
- Grok Imagine 大赛参赛者全流程制作 5 分钟奥德赛短片 — Kyrannio · 2026-09-03
- 全球首个全 AI 视频流媒体上线,用 MiniMax 模型生成整部电影 — jfischoff · 2026-09-03
- Muse Spark 1.3 一句话生成 Minecraft 克隆画面,效果意外能打 — alexandr_wang · 2026-09-03
- Muse Spark 1.3 生成可交互 3D 日式庭院,Scale CEO 盛赞大跃升 — alexandr_wang · 2026-09-03