开源 Sound / Vision:一台本地 GPU 从写歌到 MV 全流程搞定
LawrenceOfTheLabia · reddit · 2026-10-11
Reddit 用户开源了 Sound / Vision:一个自托管 Web 应用,跑在本地 Linux GPU 机器上,从一句话创意到成品歌曲、专辑封面再到 MV 一条龙完成。
功能
- 歌曲:用 YuE2、ACE-Step 1.5 或 MiniMax Music 3 在本地 ComfyUI 生成,支持批量出多版、翻唱、上传自己的音轨
- 分析:自动拆 stems、节拍、段落与逐词歌词时间轴
- 封面:本地模型(Krea 2、Qwen Image 2.1)生成,统一排版署名与 logo
- 视频:动态封面、按歌曲真实时序写代码的 motion graphics、用 MiniMax H3 做对口型的叙事 MV
- 分享:自动剪出适配 TikTok/Reels/Shorts 的字幕短视频
- Influence Engine:从你选的歌训练「声音风格」引导 YuE2
架构与限制
- FastAPI + systemd 用户服务,ComfyUI 与分析工具跑 Docker,局域网免密、外部设备 token 配对
- 也可接入 Ollama 本地 LLM 或用自己的订阅登录 Claude/ChatGPT/Grok,无需 API key;支持加 MCP 服务器调用托管模型或 ElevenLabs Music
- 需要 24–32 GB 显存的 NVIDIA GPU(作者用 5090 开发)、约 200 GB 磁盘,首次安装约 1 小时
- YuE2 许可证禁止商用,MiniMax H3 排除美欧韩等地使用
- MIT 许可,README 从裸 Ubuntu 写起
「编程与Agent」频道最新
- 零融资零广告,GPT Researcher 开源项目突破 3 万星 — EdenEmarco177 · 2026-10-11
- shadcn 自述:为组件打磨数周抽象,AI 尚未加速设计只能加速试错 — shadcn · 2026-10-11
- 7 周生产级 Agentic RAG 免费课程开源,GitHub 已收获 9.7k 星 — mdancho84 · 2026-10-11
- Arize AI 演示 agent 自学习闭环:遥测数据自动发现并修复生产故障 — AI Engineer · 2026-10-11
- 重度用户实测:让 AI 编码智能体 24/7 跑活,周额度两天耗尽 — gandamu_ml · 2026-10-11
- 上线前6天发现代码里模型名是AI幻觉编造的,130个测试全没拦住 — Trout_dev · 2026-10-11