LTX 2.5 视频模型实测:无法按指定台词生成语音
Lost_Lab_739 · reddit · 2026-08-14
作者测试了 LTX 2.5 模型试图生成带有特定台词的视频,但发现模型只能生成背景音乐或类似人类发声的胡言乱语,无法准确说出指定的文本。深入代码检查发现,音频和视频均由同一个文本提示词生成,缺乏输入特定脚本或转录文本的接口。
在排错过程中,作者发现了两个关键问题:
- 缺少关键节点:ComfyUI 提供的官方模板中缺失了 LTXVModalityGuidance 节点,该节点负责将音频与视频关联并处理唇形同步。未添加该节点会导致生成的视频只有音乐而无人声。
- 提示词增强器存在 Bug:内置的提示词增强器(Prompt enhancer)在运行时会静默丢弃用户的原始提示词,并在某些环境下输出乱码(可能是由于 fp16 精度溢出导致),导致模型接收到无效输入。
「多模态」频道最新
- AI 全流程生成 3D 游戏:Opus 5 与 Higgsfield 展示惊人 Demo — TAbrodi · 2026-08-14
- LTX 2.5 实测:2.3 版本 IC LoRA 可直接兼容 — No-Property3068 · 2026-08-14
- Luma+ElevenLabs实测:AI生成逼真第一视角弹吉他 — mrjonfinger · 2026-08-14
- 开源工具 Reel Video:组合订阅 API 将 AI 视频成本降至每月 50 美元 — StepUpPrep · 2026-08-14
- ComfyUI-H3-FaceRefine 节点实测:大幅提升视频面部细节 — Devajyoti1231 · 2026-08-14
- Flora 推出 Fashion Studio,赋能时尚创意全流程 — round · 2026-08-14