爱诗科技发布 PixVerse R2:实时世界模型同时兼顾通用能力
量子位 · wechat · 2026-09-23
爱诗科技上线全新实时世界模型 PixVerse R2,上线即冲上 X 平台热度总榜,主打让实时性与通用能力"既要又要"——把 LLM 的 Scaling 逻辑搬进实时世界模型。
文章指出实时世界模型长期面临两道门槛:视觉信息缺乏文本那样的统一 Token 表征体系,且模型容量与毫秒级实时计算预算天然互相拉扯(如 DeepMind Genie 系列需以蒸馏和画质为代价换实时)。
R2 的技术路线分两层:
- OmniCausalAR:统一视觉、动作、音频、时序与控制信号的因果自回归框架,通过动态 Chunk 适配时间尺度,用 HybridTeacher/Diffusion Forcing、多时间尺度记忆和 ErrorBank 解决误差累积、角色漂移与状态断裂;把 Scaling 拆成模型、数据、任务、控制信号、时间尺度五个协同增长维度
- Real-TimeAcceleration:先做高基础模型能力上限,再整体蒸馏进实时加速层
实际体验中,R2 支持 WASD 控制方向、用 Prompt 修改角色动作与剧情,画面实时生成、几乎无卡顿,可玩探险世界、互动影游和实时数字人。文章认为该路线可能外溢到具身智能、虚拟人与游戏实时渲染等场景。
所属事件:爱诗科技发布实时世界模型 PixVerse R2,可玩可改的 AI 世界(18 条相关)→
「多模态」频道最新
- 开发者实测后炮轰 Higgsfield:UI 上限极低,批量出片只能靠 API 加编码 agent — vaibhavbetter · 2026-09-25
- Higgsfield 被指"半骗局":作者实测称其上限极低,靠营销收割 — 5le · 2026-09-25
- 一张图加一条提示词,生成完整 30 秒视频 — umesh_ai · 2026-09-25
- 用 Claude Opus 5.5 生成 6300 帧动画,做出苏轼一生中秋 MV — dotey · 2026-09-25
- 开源数据集 FineVision 获 NeurIPS 接收:17M 图、200 余源 — andimarafioti · 2026-09-25
- MiniMax H3 疑似「微笑过拟合」: bored 毛毛虫视频翻车实录 — episodex86 · 2026-09-25