ComfyUI-QwenASR v1.1.0 发布:接入官方 Qwen3-ASR、智能 ITN 与长音频强制对齐
Narrow-Particular202 · reddit · 2026-09-12
ComfyUI-QwenASR 发布 v1.1.0 大版本更新,目标是打通 ComfyUI 工作流中「原始语音识别到可用文本/字幕」的最后一公里:
- 迁移到 Transformers 5 与官方原生模型:弃用旧 checkpoint,改用 Qwen3-ASR-1.7B-hf、Qwen3-ASR-0.6B-hf、Qwen3-ForcedAligner-0.6B-hf(transformers ≥ 5.13.0),纯上游 PyTorch 执行,NVIDIA GPU 和 Apple Silicon Mac 上显存更低、速度更快。
- 生产级逆文本归一化(ITN):口语数字/百分比/小数自动转标准数字,音节分隔缩写("A S R"→ASR)自动合并,内置白名单保护成语和专有短语不被误替换。
- 热重载多语言自定义词典:归一化规则外置在 itnrules.,可自定义缩写、品牌词(DeepSeek、ComfyUI 等),支持英/中/日/韩/法,改完下次运行即生效,无需重启。
- 三节点工具包:ASR 节点做轻量语音转文本(适合语音提示词);Subtitle 节点按标点/停顿/行长分句并可一键导出 .srt;Forced Align 节点面向播客、讲座等长音频,用迭代语速窗口防止边缘漂移,留空转写文本可一步完成转写+对齐。
安装步骤和示例工作流见 GitHub README。
「多模态」频道最新
- GPT-6 Astra + Seedance 2.5 + CapCut 工作流:3D 白模变广告片 — HeyAmit_ · 2026-09-12
- 撕纸对比视频出炉:视频生成物理真实感一年间大幅进化 — sabage27 · 2026-09-12
- 实测 Gemini Astra:一句话去掉 AI 图的油光感元素 — floguo · 2026-09-12
- Nari Labs 开源 Qwen3-TTS 1.7B:延迟仅 50ms,成本降 10 倍 — alexcovo_eth · 2026-09-12
- 用 ComfyUI+Minimax+Krea 2+Suno,4 小时在 5090 上做出短片《苍蝇》 — aurelm · 2026-09-12
- ImagineArt Computer 直播实测:T恤设计能力令人惊喜 — Kyrannio · 2026-09-12