实测:将 Qwen3-ASR 延迟优化至 70ms

Comprehensive_Quit67 · reddit · 2026-08-25

作者通过优化推理流程,将 Qwen3-ASR 1.7B 模型的流式语音转录延迟从 Baseten 和官方提供的约 400ms 大幅降低至 70ms,从而在保持优于 Deepgram 的准确率(WER、多语言)的同时,解决了其速度短板。作者未修改模型权重,主要针对服务端推理效率进行了改进。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →