专题 · FULL STORY

PixVerse R2:可交互的实时世界模型发布

爱诗科技于 9 月 22 日至 25 日发布实时世界模型 PixVerse R2 并开放试玩,将 AI 视频从「提示词生成」变为可走进、可对话、可修改的流式交互体验,上线即冲上 X 热度总榜。随后技术报告与解读揭示其核心为 Dynamic Chunks 动态分块机制,多位博主完成上手实测。

2026-09-22 ~ 2026-09-25 · 3 集 · 28 条

第 1 集 · 爱诗科技发布实时世界模型 PixVerse R2,可玩可改的 AI 世界(2026-09-22,18 条)

爱诗科技于 9 月 22 日至 23 日发布实时世界模型 PixVerse R2 并开放试玩,上线即冲上 X 平台热度总榜。R2 把 AI 视频从「提示词→生成→观看」的线性流程变成可进入、可交互的活世界,多位实测者称体验惊艳,但试玩时长因算力限制较短,方向本身被普遍视为实时视频生成的重要进展。

已确认

  • R2 开放试玩:用户可用 WASD 在生成的世界中自由移动、切换镜头、实时探索环境,动作会传导因果——火会点亮场景、点燃草地、改变后续走向,而不只是画面移动。@SarahAnnabels 指出这不是预渲染的游戏画面,而是实时生成的音视频世界,核心在于生成与响应同时进行;@antharaai、@HeyNayeem 均强调关键变化在于移动与提示词的结合方式,体验从「看视频」变成「走进视频」。
  • 用户可用提示词实时控制与编辑世界、直接修改世界规则、塑造故事线,例如驾车穿越开放地形时重塑环境、召唤彩虹;世界中的角色具备记忆并能回应用户交互。官方称体验像大制作动作 RPG,但没有过场动画。
  • 交互式叙事能力:故事不再局限于几条预定义分支,AI 根据用户自然语言输入实时生成故事的下一部分,用户可做选择、引导剧情;有体验者评价这「更像共同创作故事,而非观看故事」。基于 R2 的交互式电影冒险体验「Zero Mark」还支持仅输入单个词就改写剧情走向,无需长 prompt,并放出 gameplay 演示。
  • 据官方介绍(经 @nikolamr64990 转述),R2 采用双核心引擎设计,将「能力与效率解耦」:实时性偏向更小更快的模型,通用性偏向更大、理解更广的模型,以此正面应对实时世界模型能否规模化的核心矛盾,目标不仅是提速,还包括处理动态变化的输入。
  • 据量子位报道,R2 主打实时性与通用能力兼顾,把 LLM 的 Scaling 逻辑搬进实时世界模型;实时世界模型长期面临视觉信息缺乏文本那样的表达结构等门槛。
  • 实测反馈:@aziz4ai 称生成与编辑像玩游戏一样实时可控;@umeshai 称世界在身处其中时持续生成,场景持续存在而非一次性,体验从观看变成探索;@XianbaoQIAN 实测称「无尽的探索旅程」放松有趣,适合当壁纸或屏保,但因算力限制只被允许玩了很短一段时间,并期待后续发展。

尚未确认

  • @XianbaoQIAN 提出的一个方向性猜想(帖子被截断,涉及 Jet…),具体内容未在材料中完整呈现。

为什么重要

  • 世界模型正在把生成式 AI 从被动观看的视频片段推向可进入、可编辑、有因果与记忆的持续世界,被视为实时视频生成与互动娱乐方向的关键进展;有评论者将体验类比为 3A 动作 RPG,认为 AI 视频正从「看的内容」变成「可体验的东西」。
  • R2 以双引擎解耦实时性与通用性的思路,回应了实时世界模型规模化这一行业核心矛盾,其后续扩展表现值得关注。
  • 交互式叙事若脱离预定义分支,将显著拓展游戏、互动影视等内容形态的想象空间;算力限制下的限时试玩也提示大规模实时交互的落地成本仍是现实约束。

第 2 集 · PixVerse 发布实时世界模型 R2:可走进、可对话的流式 AI 视频(2026-09-23,8 条)

PixVerse 于 9 月 24—25 日前后发布实时世界模型 R2 并公布技术报告,多位博主随后完成上手实测。R2 的核心变化在于把 AI 视频从「输入提示词、输出一段片段」的一次性渲染,转变为持续流式输出画面与声音的可交互世界:用户不必关掉镜头,可以一直留在场景里,用 WASD 移动、控制镜头,通过与模型对话、投喂参考素材、插入音频等方式实时改变世界中正在发生的事,环境会对身处其中的用户做出响应。

已确认

  • PixVerse 正式发布实时全模态世界模型 R2 并发布技术报告;据 @futurecoded 转述,核心框架为 Omni Causal AR,在数据、模态、任务、控制信号和时间跨度上持续扩展流式视频生成基础,并配合 Real-Time Acceleration 实现实时音视频生成。
  • @HeyToHa 实测:从 Gallery 选一个 AI 生成的世界后,可用 WASD 移动、自由控制镜头,并用提示词实时改变世界中的事件,世界会实时响应。
  • @futurecoded 实测:R2 支持边生成边交互,可实时对话、喂参考图、加音频、移动视角,画面与声音持续流式输出。
  • 官方宣传中,用户可以探索持续运行的 AI 生成世界、用提示词实时控制和编辑场景,还能遇到会记住交互并做出回应的角色;转发帖中还提到输入「火焰魔法」等自然语言指令可让角色实时释放火焰并影响路径上的物体。

为什么重要

  • @futurecoded 认为 R2 代表 AI 视频的新范式:下一帧由已发生的状态加上玩家操作共同决定,用户是在「驾驶一个预测」而非加载烘焙好的地图,AI 视频开始具备游戏引擎属性。
  • @HeyToHa 与 @Ronycoder(经 @HeyAmit 转发)均表示这已不是「看视频」,而更接近走进一个可交互的世界,标志着生成式视频向持续可停留体验的转向。

第 3 集 · PixVerse R2 世界模型采用动态分块技术(2026-09-24,2 条)

PixVerse 交互式世界模型 R2 的技术细节得到进一步解读:其核心机制是 Dynamic Chunks(动态分块),不再将所有输入当作固定时长窗口,而是根据控制信号类型自适应决定生成时长。例如 WASD 键盘输入需要极快、细粒度的处理,不同输入对应不同时间粒度。此外模型还通过多时间尺度记忆来维持世界一致性,使长程交互中的场景保持连贯。