Sori-1B:零文本预训练的音频 grounding 语言模型
Balance- · reddit · 2026-08-31
SNU 研究员发布了 Sori-1B,这是一个 10 亿参数的音频语言模型,其核心特点是解码器完全从零开始在音频配对文本上训练,不进行任何纯文本预训练或使用预训练 LM 初始化。
技术亮点:
- Audio-Grounded: 旨在让模型回答基于音频而非依赖文本先验(实验显示 AF3 在静音下仍保留 74% 的表现,证明其依赖文本)。
- 架构复用: 冻结了 NVIDIA 的 Audio Flamingo Next 编码器(占 61.5% 参数),其余部分(解码器、嵌入层、基于音频概念的自定义 tokenizer)均从头训练。
- 训练规模: 使用约 7400 小时/475 万样本,仅需 3 张 RTX 4090。
- 功能: 支持 MCQ、开放式问答、字幕生成和 ASR。
- 许可: 权重仅限非商业/学术用途(因使用了 NVIDIA 的非商业编码器)。
「多模态」频道最新
- 法国导演用 AI 视频生成短片《La Nona Gigante》 — venturetwins · 2026-08-31
- MiniMax H3 Max 视频生成速度超越播放速度 — isidentical · 2026-08-31
- 探索思维转视频:生成式实验与视觉语法探索 — Kyrannio · 2026-08-31
- Grok 与 GPT 同指令生图,结果惊人相似 — teortaxesTex · 2026-08-31
- 单条提示词生成手绘纪录片,H3模型讲透三种咖啡差异 — Best_Candidate_9060 · 2026-08-31
- 8GB 笔记本跑 Minimax H3:罗马晚宴视频生成全流程复盘 — DG86 · 2026-08-31