微软将 VibeVoice-ASR 压到 1.58GB,面向边缘 CPU 实时语音识别
Balance- · reddit · 2026-07-28
微软的 VibeVoice-ASR-BitNet 是 VibeVoice-ASR 的压缩版,目标是在边缘 CPU 上做实时语音识别。
- 通过异构量化,把模型体积从 4.62 GB 压到 1.58 GB。
- 官方称推理速度比 Whisper.cpp 快 1.6–2.3 倍。
- 在仅 3 个 CPU 线程 上就能达到 RTF < 1 的实时能力。
- 这使它成为一个无需 GPU 的端侧语音识别方案。
「多模态」频道最新
- Flux 3 用盗摄金属现场提示词追求粗粝真实感 — fofrAI · 2026-07-29
- 0.5B 参数的实时键盘控制视频模型已能交互运行 — multimodalart · 2026-07-29
- NVIDIA PDD 用 4–8 步蒸馏加速图像和视频生成 — nvidia · 2026-07-29
- VisoMaster 开源换脸工具支持图像视频与表情微调 — tom_doerr · 2026-07-29
- 用 img 2.0 生成的 Elon 与 Sam 对话梗图 — SkyNo7576 · 2026-07-29
- ComfyUI 0.29 增加流式视频与 GPT 5.6 节点 — pytraveler · 2026-07-29