微软发布 VibeVoice-ASR-Streaming-7B:流式语音识别开源模型
microsoft · hf · 2026-09-02
微软在 Hugging Face 发布 VibeVoice-ASR-Streaming-7B,一个 7B 参数的流式自动语音识别(ASR)模型,支持语音转文字(Speech-to-Text)与转写任务,覆盖中文与英文,基于 transformers 架构并以 safetensors 格式提供权重。
「多模态」频道最新
- Fable 5.1 生成 three.js 网站实测:快且精准,但细节仍需人把关 — repligate · 2026-09-03
- 疑似 MiniMax H3 Max 开源权重现身 Hugging Face,8×B200 可实时运行 — BassNet · 2026-09-03
- Nano Banana 2 加 MiniMax H3 Max 等四模型,拼出点击式冒险探索游戏 — yshan2u · 2026-09-03
- ComfyUI 新节点:图/视频/音频参考素材加载,自带裁剪、缩放与裁剪时长 — grimstormz · 2026-09-03
- 从"提示碰运气"到"导演式创作":视频生成的产品分层困境 — Kyrannio · 2026-09-03
- World Labs 发布视频生成新模型 Atlas — mildlyphd · 2026-09-03