LTX 2.5 不出语音元凶找到:AMD 卡上 PyTorch 注意力后端算错
Captain_Doobie · reddit · 2026-09-09
一位 RX 7900 XTX 用户排查 LTX 2.5「无视提示词、不出对白」多日,最终定位到根因:不是工作流或提示词问题,而是 PyTorch 在 AMD/HIP gfx1100 架构上的 scaled-dot-product attention 后端算错了。
- 症状:视频能生成但对白变成音乐/乱码,主体和构图漂移,常冒出字幕;同一提示词在 LTX 2.3 完全正常。
- 排查:换种子、删提示词增强器、换量化编码器、官方 BF16 权重全部无效;逐层对比 Hugging Face Gemma 4 参考计算,发现前 5 层吻合,第一个全局注意力块开始剧烈发散,Q/K 投影和位置编码正常,问题出在选定的 SDPA 后端内部。
- 修复:给 ComfyUI 的 gemma4.py 打补丁,仅在「AMD/HIP gfx1100 + 注意力头维度 512 + BF16/FP32 + 带 mask」这组条件下强制用 SDPBackend.MATH,其余路径不变。修复后编码器输出与参考计算相对 L2 误差约 0.42%,余弦相似度 0.99999,问题解决。
「多模态」频道最新
- Seedance 2.5 恐怖短片:只有 16 层的楼,谁按了 17 层 — umesh_ai · 2026-09-09
- 两年前花 50 美元训练的 LoRA,如今 ChatGPT 一句话就能替代 — jacob_posel · 2026-09-09
- GPT-6 Astra 配 DAW 复刻《骑士之舞》全编制管弦乐细节 — petewoodbridge · 2026-09-09
- 用 Opus 5 + Fable 5.1 加 Blender 生成动画的工作流演示 — prasenx · 2026-09-09
- DynHair 登 ECCV 2026:多视角视频重建动态 3D 发丝虚拟头像 — Michael_J_Black · 2026-09-09
- 本地长片 AI 视频工作站:ComfyUI 跑 MiniMax H3 全流程 — mnm9678 · 2026-09-09