Reddit 实测多款音频模型听歌写视频脚本,Qwen3.5 Omni Plus 最准
mwoody450 · reddit · 2026-09-13
一位 Reddit 用户分享为流行歌曲制作 MV 的工作流测试:用音频模型分析 3 分 17 秒的歌曲《Les Fleurs》,生成带时间戳的分段描述,再喂给视频生成模型。由于能听音频的模型不足以生成复杂的多段 JSON,他采用「音频模型写文字描述 + 强模型消费」的两段式方案,并以匿名文件名防止模型靠歌名作弊。实测结论:
- Qwen3.5 Omni Plus:曲目长度精确到秒,准确命中 1:04 的管弦乐铺垫和 1:17 的副歌爆发,主题总结到位,综合最佳
- Gemini 3.8 Flash 内容最好但时间戳整体偏早几秒
- Mimo 2.5 Thinking 能识别节奏变化、正确指出 3:15 的淡出,但错过第一个铺垫点
- Gemini 3.1 Pro Preview 漏掉了 1:17 的关键节拍点
- Muse Spark 1.2/1.3 与 Inkling Thinking 实际未收到音频,凭空编造了不存在的歌曲
「多模态」频道最新
- Seedream 团队发布 VoT:像素渲染前先进行视觉思考 — JingxiangSun42 · 2026-09-13
- Wan 2.2 突然输出抽象波浪画面,或与 Blackwell fp16 累加不稳定有关 — deviruchii · 2026-09-13
- Krea 2 角色还原度实测:不挂 LoRA 约一半成功率 — magik_koopa990 · 2026-09-13
- 腾讯开源 WeMM-Embedding,3060 上跑视频检索 — huangyun_122 · 2026-09-13
- 用 Codex 加 Astra 生成厚涂油画质感的复古未来主义 GIF — mhmazur · 2026-09-13
- 8GB 显存跑 MiniMax:5 张图 17 分钟生成短视频草稿 — Creative_aidumpster · 2026-09-13