Runway 联合创始人谈世界模型:从视频生成押注机器人与神经操作系统
maxlife99 · reddit · 2026-09-25
Latent Space 播客对话 Runway 联合创始人 Anastasis Germanidis,回顾公司从创意工具到前沿视频模型再到世界模拟的路线:
- 早期押注 1000 张 A100 集群启动视频研究,并参与 Stable Diffusion 的开发;Gen-2 源于一个结合文本、深度与视频的周末实验。
- Gen-3 在三个月内规模扩大约 10 倍;OpenAI 发布 Sora 时公司内部曾经历“Runway 完了”的时刻。
- 他认为直接从物理世界学习可能解锁语言无法覆盖的能力,纯扩展视频预测也许足以教会模型物理,实时视频生成不可避免。
- 提出 Interface World Models:用神经网络直接渲染软件界面像素,取代 HTML/CSS/React,终局可能是完全神经化的操作系统。
- 世界模型正被用作机器人仿真器,第三人称互联网视频可能是机器人智能最大的训练来源;World Action Models 把视频模型转化为机器人策略。
- 还提出衡量世界模型的“Lucid Dream Test”,并谈到视频 agents、omni 模型、开源世界模型与全球视频生成竞赛。
所属事件:Runway 联创:视频生成只是起点,目标是世界模拟(2 条相关)→
「具身」频道最新
- 用 iPhone LiDAR 做攀岩 3D 分析:开源视觉工具链解读 — dosco · 2026-09-25
- Menlo 开源人形机器人 Asimov 1 运动控制策略与训练代码 — freelerobot · 2026-09-25
- IROS 2026 人机对话研讨会下周举行,MIT 与 NVIDIA 讲者云集 — dhadfieldmenell · 2026-09-25
- 俞翔将出席 NSF FRR 机器人年会并在 IROS 展示导航研究 — YuXiang_IRVL · 2026-09-25
- 北大团队发布 OmniEcho:让具身智能听懂空间声音的基准与模型 — PKU-VaLuE-Lab · 2026-09-25
- World Action Agent:VLM 驱动机器人操作,LIBERO-Pro 成功率 75.6% — Yehang Zhang · 2026-09-25