Yue2 releases AudioEncoder model, enabling Audio2Audio workflows like image-to-image

TomLikesRobots · x · 2026-09-13

Yue2 has released an AudioEncoder model alongside its standard generation model, converting audio into latent data so users can do "Audio2Audio" transforms. A creator tested it by regenerating an earlier MV track: overall vibe preserved, with new nuances and vocal timbre — an interesting arrangement tool. Note: omitting lyrics yields English-like gibberish instead of Japanese. The quoted post is an AI-generated MV combining Qwen3.8-27B for lyrics, AceStep1.5XL for music, Krea2 for characters, and MinimaxH3 Ref2V for video.

Original post →

More from Multimodal

Multimodal channel →