新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架
NationalUniversityofSingapore · hf · 2026-09-30
新加坡国立大学团队提出 StoryEngine,一个面向长篇视频叙事的「状态锚定」智能体框架。
要解决的问题:现有多镜头智能体视频生成只依赖文本分镜或已生成的像素,缺少跨镜头传播事件后果、维护视频世界状态的机制,导致视觉细节被错误重建、视觉漂移在镜头间累积,破坏叙事连贯与画面一致性。
核心方法:
- 区分「权威语义计划」与「不可靠视觉观察」两层表示
- 维护实体位置与故事相关状态的结构化表示,把事件引发的变化传播为每个镜头的起止状态
- 为反复出现的实体和环境构建规范参考,将状态与视觉约束编译成可执行的渲染计划
- 引入有界评估引导的修复循环,纠正局部状态不一致,防止误差跨镜头传播
团队还构建了覆盖多场景、多视觉风格的长篇叙事 benchmark,从叙事质量、连贯性、视觉一致性等维度评测。实验显示 StoryEngine 在所有评估维度上均超过现有 SOTA 方法。
「多模态」频道最新
- Midjourney v8.2 新玩法:4 个虚构 token 玩出记忆残影与骨骼回声 — LudovicCreator · 2026-09-30
- 开发者直言超个性化音乐是伪命题:音乐本质是社交文化 — jordiponsdotme · 2026-09-30
- 本地生图一年:从 Civitai 到 ComfyUI,体验为何都烂 — BenDLH · 2026-09-30
- 用 Opus 50 分钟做出 Violetto 1B 宣传片,几乎零媒体关注 — tensorqt · 2026-09-30
- Meshy 两年 ARR 从百万冲到一亿美元,AI 3D 成超新星生意 — 量子位 · 2026-09-30
- 蒸馏视频模型频现伪影,作者长文剖析 LoRA 失配根源 — burkov · 2026-09-30