SonicCaps:1500 万条字幕音频数据集发布,提升 CLAP 检索与零样本分类
serrjoa · x · 2026-09-03
- 论文发布 SonicCaps,一个大规模音频字幕数据集:约 1500 万条字幕配约 70 万段音频,用多模态大模型 Qwen3-Omni 基于音频+文本生成。
- 为提升多样性,通过结构化 prompt 工程与 few-shot 生成,每段音频产出约 24 条字幕,涵盖主描述、改写变体(详略/风格)与语义标签,解决现有数据集语义单一、描述泛泛、一对一映射无法反映听觉歧义的问题。
- 人类评估显示其字幕比现有数据集显著更描述性、更精确;用多字幕采样策略训练 CLAP 一致提升音频检索与零样本分类,并在公开与商业基准上有更强泛化。数据集与两个专用 CLAP 模型已在 Hugging Face 开源。
「多模态」频道最新
- Gemini 视频 token 省 88% 的关键更新落在 3.7 Flash 而非 3.8 — Servola-Journal · 2026-09-03
- 开源 ArtSmoker:一条提示词直出带贴图可入引擎的 3D 模型 — niravdd · 2026-09-03
- Midjourney 角色设定图+Seedance 长视频,复刻 70 年代意式惊悚片 — Kyrannio · 2026-09-03
- Midjourney 猫女角色概念探索图集 — hewarsaber · 2026-09-03
- 用 MiniMax H3 先拍 360° 环绕视频,解决 AI 动画背景不一致难题 — Hailuo_AI · 2026-09-03
- Fable 5.1 一次生成完整 W16 发动机 CAD 模型与动画 — repligate · 2026-09-03