让 LLM 边看边改 prompt:音频驱动视频漂移实验做成迷幻名场面

ART-ficial-Ignorance · reddit · 2026-09-04

作者用 Gemma 12b + LTX 2.3 + 音频响应 LoRA + Wan2GP 做了一个受控幻觉实验:先让 LLM 掌握整支视频的结构、每段画面意图和音乐能量节点,但不预写全部场景 prompt;每生成一段约 6.9 秒的片段,就把该段末帧'喂回'给 LLM,让它基于实际累积的伪影和整体规划写出下一段 prompt,持续把漂移的画面拉回既定叙事弧线。相比此前无限走廊场景(新几何不断掩盖错误),这次用固定机位拍摄单个变形物体,结构错误会持续累积、更快失稳。最终视频从一件简单黑色陶瓷形体逐步发展出自己的视觉语法,失稳重组后演变成类似分布式网络的表面。下一步计划让 LLM 控制 LoRA 强度等参数。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →