让 LLM 边看边改 prompt:音频驱动视频漂移实验做成迷幻名场面
ART-ficial-Ignorance · reddit · 2026-09-04
作者用 Gemma 12b + LTX 2.3 + 音频响应 LoRA + Wan2GP 做了一个受控幻觉实验:先让 LLM 掌握整支视频的结构、每段画面意图和音乐能量节点,但不预写全部场景 prompt;每生成一段约 6.9 秒的片段,就把该段末帧'喂回'给 LLM,让它基于实际累积的伪影和整体规划写出下一段 prompt,持续把漂移的画面拉回既定叙事弧线。相比此前无限走廊场景(新几何不断掩盖错误),这次用固定机位拍摄单个变形物体,结构错误会持续累积、更快失稳。最终视频从一件简单黑色陶瓷形体逐步发展出自己的视觉语法,失稳重组后演变成类似分布式网络的表面。下一步计划让 LLM 控制 LoRA 强度等参数。
「多模态」频道最新
- fal 发布 H3 Max Turbo:视频生成速度翻倍、价格减半 — stuffyokodraws · 2026-09-04
- CAT-Flow 免训练自适应步长,Flow Matching 生成步数最多省 40% — chaumian · 2026-09-04
- 文本直接生成 4D 高斯场景,Reddit 演示首次跑通 — solo_solipsist · 2026-09-04
- 单张照片重建整个校园:博主用 Atlas 复刻马里兰大学 CS 楼 — gowthami_s · 2026-09-04
- 奥斯卡提名编剧写一场戏,八组 AI 艺术家各自拍成短片 — egeberkina · 2026-09-04
- 即将发布的 Quiver Arrow 2.0 生成复古怪诞插画,全程代码绘制 — stuffyokodraws · 2026-09-04