SonicCaps:1500 万条字幕音频数据集发布,提升 CLAP 检索与零样本分类
serrjoa · x · 2026-09-03
- 论文发布 SonicCaps,一个大规模音频字幕数据集:约 1500 万条字幕配约 70 万段音频,用多模态大模型 Qwen3-Omni 基于音频+文本生成。
- 为提升多样性,通过结构化 prompt 工程与 few-shot 生成,每段音频产出约 24 条字幕,涵盖主描述、改写变体(详略/风格)与语义标签,解决现有数据集语义单一、描述泛泛、一对一映射无法反映听觉歧义的问题。
- 人类评估显示其字幕比现有数据集显著更描述性、更精确;用多字幕采样策略训练 CLAP 一致提升音频检索与零样本分类,并在公开与商业基准上有更强泛化。数据集与两个专用 CLAP 模型已在 Hugging Face 开源。
「多模态」频道最新
- 网友用 GPT-6 Astra 生成马斯克照片,真实感令人惊讶 — djcows · 2026-09-05
- 电影感修图 prompt:模拟全画幅相机的质感与景深 — TawohAwa · 2026-09-05
- 硬光废片救回 prompt:一指令改成影棚级人像 — TawohAwa · 2026-09-05
- 模糊人像锐化 prompt:保脸换清晰度的完整写法 — TawohAwa · 2026-09-05
- 网传 ChatGPT 图像新玩法:6 组 prompt 把废片修成专业照 — TawohAwa · 2026-09-05
- 做 AI 网红遇坑:Flux Krea 换 Klein 后真人感直线下降 — Weird_Ad4978 · 2026-09-05