LTX 2.5 视频模型实测:无法按指定台词生成语音

Lost_Lab_739 · reddit · 2026-08-14

作者测试了 LTX 2.5 模型试图生成带有特定台词的视频,但发现模型只能生成背景音乐或类似人类发声的胡言乱语,无法准确说出指定的文本。深入代码检查发现,音频和视频均由同一个文本提示词生成,缺乏输入特定脚本或转录文本的接口。

在排错过程中,作者发现了两个关键问题:

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →