想用 LoRA 训「广播剧生成器」?目前没有统一方案
wh33t · reddit · 2026-09-22
Reddit 用户探讨如何训练一个「音频广播剧」生成模型:现有 TTS、音乐、视频、音效生成器各自为政,没有任何系统能用一个统一 prompt 把对白和背景音效一起生成(比如开门吱呀声、混凝土上的靴子声、虎啸等)。作者想知道训练音频广播剧 LoRA 该用什么架构或平台,欢迎讨论。属于开放性问题求助,尚无答案或实操细节。
「多模态」频道最新
- Reddit 用户用 MiniMax H3 + SeedVR2 打造睡眠瘫痪短片 — Warp_d · 2026-09-22
- Qwen Image 2.1 换脸实测:ComfyUI 模板免遮罩一句话搞定 — sci032 · 2026-09-22
- MiniMax H3 Max 登顶 Design Arena 视频编辑榜,Elo 达 1373 — noahsolomon · 2026-09-22
- Reddit 用户实拍片段 AI 改造成动作戏,前后对比惊艳 — nav132 · 2026-09-22
- Reddit 实测:Nano Banana Pro 完胜 GPT Images 2.5 太空舱场景 — opmgyhx · 2026-09-22
- Grok 4.7 在 BuildingBench 3D 生成榜跃升至第三,成本仅 Fable 的三分之一 — ZhitingHu · 2026-09-22