Reka Labs 提出 Omni-World Models:单一架构统一语言与物理世界
RekaAILabs · x · 2026-09-17
Reka Labs 发布研究博客,主张 LLM 只是通向物理世界智能的中间步骤,并提出「omni world models」路线。核心观点:
- 单一统一架构:同时处理语言、图像、音频、视频等多模态输入,并输出图像、视频、动作等多种模态,而非多个 agent 的编排组合。
- 技术难点:需同时建模离散信号(文字)与连续信号(波形、像素),现有架构要么自回归处理离散、要么用 diffusion 处理连续,混合模型是折中方案。
- 动机:真实物理世界涉及运动与几何规律,纯文本 scale-up 不够;统一 VLA 与世界模型(WAM)方法才能支撑物理世界智能。
该文将 omni 模型定位为 LLM 演化的下一阶段。
「多模态」频道最新
- 实测 GPT-Image 2.5:同一张图反复编辑 5 轮仍不崩 — rms80 · 2026-09-18
- 完整教程:用 Higgsfield API + Seedance 生成电影感巴黎 Vlog 视频 — EXM7777 · 2026-09-17
- SoundBoost 推出 MV 生成器,可按歌曲节拍剪辑完整音乐视频 — TheChuckTone · 2026-09-17
- STEER 开源:双向对话驱动的可控 3D 头部虚拟人面部动作生成 — rsasaki0109 · 2026-09-17
- Krea 2 出概念图 + Minimax H3 生成,几分钟完成角色转台动画 — Tamerygo · 2026-09-17
- 疑似 Minimax H3 惊艳视频流出,作者拒公开工作流 — jonbristow · 2026-09-17