Hojo-ASR-Multi-V1 上架 HF:Qwen3 解码器架构,Apache 2.0 开源
rohanpaul_ai · x · 2026-09-04
Hojo-ASR-Multi-V1 的 Hugging Face 模型卡公开技术细节与用法:基于 Qwen3 LLM 解码器的 Encoder-Adapter-LLM 架构,采用多帧声学融合结构,经多阶段模块化训练与强化学习优化,在噪音、口语化发音等复杂场景表现良好,支持德法西葡日意阿韩俄等多语言。Apache 2.0 协议开源,可通过 pip 安装 hojo-asr 包快速推理。
所属事件:开源多语言 ASR 黑马 Hojo-ASR 平均 WER 3.54% 全球第 7(2 条相关)→
「多模态」频道最新
- 网友用 Claude+Codex 一遍过做出 OpenAI x HuggingFace 事件短片 — xennygrimmato_ · 2026-09-04
- GWM Worlds 2 把视频生成变成实时可交互世界模拟 — c_valenzuelab · 2026-09-04
- ComfyUI 推出 FDC 计划:专家驻场帮企业落地创意工作流 — cpaik · 2026-09-04
- 数小时内用 AI 造出 400 首全新 EDM 流派的网络电台 — russellrosario · 2026-09-04
- 开源 OmniVoice 发布:扩散架构 TTS 支持 600+ 语言零克隆语音 — tom_doerr · 2026-09-04
- 294k 参数 TTS 跑进 337KB,可在 3 美元单片机上合成语音 — Affectionate_Hat_585 · 2026-09-04