GigaChat Audio 10B 用 Conformer 和 MoE 补上语音理解
pmttyji · reddit · 2026-07-26
GigaChat Audio 10B 是一个音频原生 LLM,基于 GigaChat 3.1 Lightning 文本底座构建。它用 Conformer 语音编码器 + 模态适配器 把音频嵌入送入 MoE 解码器,目标是在尽量保留底座文本能力的同时,补上语音理解。
这版模型支持多项音频相关能力:
- 音频问答与分类
- 长音频中的时间定位与事件描述
- 带时间戳的音频摘要
- 工具调用
- 以及纯文本任务
文中还说明,时间定位能力来自 TimeGround-1M,这是一个专门为长音频配对时间对齐标注的数据集。
「多模态」频道最新
- Krea AI 可实时生成、编辑并放大图像和视频 — Med1_Ai · 2026-07-26
- Ideogram 主打高质量作图和准确文本渲染 — Med1_Ai · 2026-07-26
- 一个可复用的运动模糊剪影提示词 — azed_ai · 2026-07-26
- Seedance 2.0 用 cinéma vérité 提示词展示视频生成效果 — techhalla · 2026-07-26
- 手机视频变成音视频作品,动作捕捉替代方案不到 50 美分 — uisato · 2026-07-26
- ComfyUI 教程演示如何用 SAM3 分割去背景 — Main-Strawberry9241 · 2026-07-26