KAIST 发布 World Observer:全景观察者让世界模型记住视野之外
kaist-ai · hf · 2026-10-02
KAIST AI 团队提出 World Observer,解决视频世界模型「以行动者为中心」的固有缺陷:物体一旦离开 agent 视野,模型往往丢失其状态,重入时表现崩坏。
核心设计:
- 解耦观察与行动:同时生成一个以 agent 为中心的 actor 视角,外加一个或多个自由布置的全景 observer,持续注视场景中选定的区域,视野外物体仍在视觉上演化,重入视野时状态得以保留。
- 几何对应:actor 与 observers 从同一全景源做 warp,建立显式几何对应;并用高分辨率参考的 Observer Sink 在物体重入时恢复细粒度外观。
- 可控性:observer 可接收控制信号,引导视野外的演化方向。
团队还提出了世界空间评测指标与覆盖真实和合成场景的新基准。结果显示 World Observer 显著改善视野外动态建模,同时在视觉保真度、相机控制与 3D 一致性上保持竞争力。
「研究」频道最新
- SECRET 免训练法缓解音视频大模型跨模态幻觉,最高提升 18 个百分点 — Yu Zhang · 2026-10-02
- 美团 LongCat 提出 N-OPSD:邻近专家池自蒸馏,AIME 均值最高提升 2.75 分 — meituan-longcat · 2026-10-02
- DMM 迭代意图去噪解多智能体寻路,1600 任务解决 1598 并扩展到百万智能体 — Valeriy Vyaltsev · 2026-10-02
- ProVer 论文:让 LLM 裁判定位关键步骤,Agent RL 超 GRPO 9.9% — omarsar0 · 2026-10-02
- 哥本哈根大学招募无分词语言模型方向博士生,办公室设在植物园天文台 — delliott · 2026-10-02
- Memorizon:流式世界模型跨重访训练,长跨度只增 12% 步时成本 — MBZUAI-IFM · 2026-10-02