Audex开源音频-文本大模型,多模态能力领先
_weiping · x · 2026-07-08
发布开源统一音频-文本大模型Audex,采用单个30B-A3B的MoE架构,将音频输入投影到文本嵌入空间。在音频理解、语音识别与翻译、语音合成、音频生成、语音到语音等任务上达到开源模型最佳水平,并在数学与代码推理、对齐和指令遵循上超过纯文本的Qwen3.5-35B-A3B。
所属事件:英伟达发布开源音频文本大模型 Audex-30B(9 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11