新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架

NationalUniversityofSingapore · hf · 2026-09-30

新加坡国立大学团队提出 StoryEngine,一个面向长篇视频叙事的「状态锚定」智能体框架。

要解决的问题:现有多镜头智能体视频生成只依赖文本分镜或已生成的像素,缺少跨镜头传播事件后果、维护视频世界状态的机制,导致视觉细节被错误重建、视觉漂移在镜头间累积,破坏叙事连贯与画面一致性。

核心方法:

团队还构建了覆盖多场景、多视觉风格的长篇叙事 benchmark,从叙事质量、连贯性、视觉一致性等维度评测。实验显示 StoryEngine 在所有评估维度上均超过现有 SOTA 方法。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →