Audio8开源多代端侧音频模型,覆盖0.1B到3B
alexcovo_eth · x · 2026-09-08
Samuel Zeng 团队宣布过去两个月通过 Audio8 向社区开源了多代端侧音频模型,当前组合包括:
- ASR(语音识别):0.1B、0.3B、0.6B、3B 四个规格
- TTS(语音合成):0.1B、0.3B、0.6B 三个规格
这些模型面向本地推理设计,部署目标涵盖手机、PC 及其他资源受限设备。
「多模态」频道最新
- AI 影集制作复盘:Agent Two 生成场景,AI 剪辑 agent 出粗剪 — LudovicCreator · 2026-09-08
- 创作者用 InVideo Agent 周更 AI 剧集,全流程零成本 — LudovicCreator · 2026-09-08
- Grok 生成的 2000 年代首尔 DV 录像逼真到无人能辨真伪 — SimplyAnnisa · 2026-09-08
- 先手绘草稿再让 ChatGPT 上色,实測解锁绘画参考新玩法 — flowersslop · 2026-09-08
- GPT-6 Astra + Seedance 2.5 实现任意视频角色批量替换 — matchaman11 · 2026-09-08
- MIT《How to AI (Almost) Anything》2026 春季课程视频全公开 — pliang279 · 2026-09-08