Reddit 实测多款音频模型听歌写视频脚本,Qwen3.5 Omni Plus 最准

mwoody450 · reddit · 2026-09-13

一位 Reddit 用户分享为流行歌曲制作 MV 的工作流测试:用音频模型分析 3 分 17 秒的歌曲《Les Fleurs》,生成带时间戳的分段描述,再喂给视频生成模型。由于能听音频的模型不足以生成复杂的多段 JSON,他采用「音频模型写文字描述 + 强模型消费」的两段式方案,并以匿名文件名防止模型靠歌名作弊。实测结论:

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →