本地音乐模型 Yue2 能否做到真·参考音频生成?社区求方案
Ambitious_Fold_2874 · reddit · 2026-09-18
Reddit 用户发帖询问:Yue2 或其他本地音乐模型能否实现真正的 reference2audio——输入参考音频后,结合上下文与用户指令生成新音频,类似 MiniMax 语音模型的 ref2va 能力。
发帖人观察:Yue2 目前的做法似乎只是从参考音频中提取音符与旋律,再用其生成音乐,而非真正以参考音频为条件做上下文感知生成。评论区在讨论本地部署下是否存在等效方案。
「多模态」频道最新
- 疑似 Qwen 新一代图像模型将至,Andrew Carr 预告又一篇爆款 — andrew_n_carr · 2026-09-18
- Video DeltaNet 混合注意力加速视频生成,768p 视频去噪仅 6.7 秒 — Haocheng Xi · 2026-09-18
- UFO 提出全条件对齐评测范式,与人类偏好相关性提升 15.25% — ustc-community · 2026-09-18
- AI 复刻《大明王朝1566》名场面,网友直呼夯爆了 — angadc · 2026-09-18
- 用 JAX 扩散模型造 3000 张合成图训练 StyleGAN 数据集 — makeitrad1 · 2026-09-18
- Pika 改版为一站式 AI 创作平台,聚合 Seedance、Nano Banana 等多家模型 — Kyrannio · 2026-09-18