Sori-1B:零文本预训练的音频 grounding 语言模型

Balance- · reddit · 2026-08-31

SNU 研究员发布了 Sori-1B,这是一个 10 亿参数的音频语言模型,其核心特点是解码器完全从零开始在音频配对文本上训练,不进行任何纯文本预训练或使用预训练 LM 初始化。

技术亮点:

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →