PixVerse 发布 R2 世界模型:Omni Causal AR 支撑实时音视频生成
future_coded · x · 2026-09-25
PixVerse 发布实时全模态世界模型 R2 的技术报告。
- 核心框架:Omni Causal AR 在数据、模态、任务、控制信号和时间跨度上持续扩展流式视频生成基础;Real-Time Acceleration 将能力带入超少步数的实时运行,无需重新学习。
- 统一多模态接口:文本、参考图、音频、动作和 agent 生成的控制信号都能更新同一个持续运行的世界状态。
- 定位:延续 R1(首个公开发布的通用实时音视频世界模型),引擎即模型——下一帧、下一声音、下一空间节拍都来自先前状态加玩家动作,而非加载烘焙好的地图。
- 早期用途:有用户用它做游戏概念验证、镜头探索、故事分支测试;角色一致性比以前更好但仍不完美。
所属事件:PixVerse 发布实时世界模型 R2:可走进、可对话的流式 AI 视频(8 条相关)→
「多模态」频道最新
- 用 Claude Opus 5.5 生成 6300 帧动画,做出苏轼一生中秋 MV — dotey · 2026-09-25
- 开源数据集 FineVision 获 NeurIPS 接收:17M 图、200 余源 — andimarafioti · 2026-09-25
- MiniMax H3 疑似「微笑过拟合」: bored 毛毛虫视频翻车实录 — episodex86 · 2026-09-25
- 浏览器端 3D 姿势编辑器 Pose Blueprint 开放测试 — OkConfusion6667 · 2026-09-25
- Reddit 用户仅调步数与 CFG 探索 AI 绘画的独立表达 — Extreme_Nice · 2026-09-25
- 不到 20 美元训练的 LoRA 让 Qwen-Image 单图转视角 — ben_burtenshaw · 2026-09-25