H3 视频生成实测:复杂场景的人物行为控制为何全靠运气?

Hdfjds · reddit · 2026-08-23

作者分享了使用 H3 模型进行复杂视频生成的实战体验,指出了一致性难以控制的现状。

测试场景:

试图生成包含 3D 厨房背景和 3 个特定人物的场景,并精确控制每个人的动作(如 A 做某事,B 做某事)。

遇到的问题:

引发的思考:

作者感到困惑,目前的生成似乎主要依赖“运气”,而非精准控制。并询问社区是如何应对这种不可控性的:是反复微调 Prompt、大量生成后筛选,还是接受不完美的结果?这反映了当前视频生成模型在复杂叙事和精确控制上的技术瓶颈。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →