NVIDIA预告SIGGRAPH 2026:发布开源世界模型与Agent栈
NVIDIA在SIGGRAPH上预告了2026年的重点更新方向,宣布将大力推进图形与仿真技术,核心在于将agentic AI(智能体AI)与physical AI(物理AI)深度结合。据作者@nordicinst转述,此举旨在打造更智能的图形系统与更逼真的模拟环境。这一战略不仅涵盖开源模型与实时仿真技术的突破,还旨在深刻影响未来的媒体制作流程。
发布开源端侧世界模型 Cosmos 3 Edge
NVIDIA发布了可在边缘GPU上运行的40亿参数开源世界模型Cosmos 3 Edge。该模型由4B参数主体和一个2B的Nemotron推理器组成,面向物理AI场景,可运行于Jetson Thor等本地设备上,能理解并生成文本、图像、视频、环境声音和动作。目前模型已完全开源,包括模型权重、后训练配方和代码,并在Hugging Face上线。据官方称,在同等规模(4B以下参数)的开源模型中,Cosmos 3 Edge在VANTAGE-Bench视觉分析榜单上排名第一,领先于前代Cosmos等模型。其应用场景涵盖机器人学习与行动、自动驾驶场景理解与意图预测,以及视觉AI agent对实时视频的推理。
追求行为真实的物理世界生成
NVIDIA表示,其研究目标不再局限于生成视觉上逼真的世界,而是要做出行为真实、可实时响应的3D世界。这些由AI生成的内容必须建立在3D基础上、遵循物理规律,并允许创作者直接控制。该技术方向将同时服务于游戏、影视、机器人以及工厂数字孪生等领域的模拟需求。
创意软件加速向“agent-ready”演进
除了底层图形与仿真的升级,NVIDIA透露了一个关键的应用层趋势:推动领先的创意应用开放Model Context Protocol(MCP,模型上下文协议)连接。此举旨在让AI agent能够直接深入到场景、镜头、时间线、素材和剪辑等具体的创作工具内部执行任务。NVIDIA将这一转变视为“加速创作”的下一阶段,意味着创意软件正在全面向“agent-ready”演进。在这一新的工作流模式下,AI承担了深入工具内部的繁重操作,而人类创作者依然保留对创作过程的最终控制权。
推出合成视频检测与桌面端Agent栈
随着AI生成内容的日益普及,NVIDIA基于其AI for Media平台推出了Synthetic Video Detector NIM微服务。该服务主要面向广播、出版等媒体机构,旨在提供能够跟上现代内容制作速度的可信验证工具,以应对日益泛滥的合成视频。此外,NVIDIA宣布桌面端也能运行“超级agent”,发布了基于DGX Station的NemoClaw开放agent栈,整合了Nemotron 3 Ultra与Omniverse等技术。
2026-07-20 ~ 2026-07-21 · 15 条相关
- 【源头】NVIDIA 预告 SIGGRAPH2026 更新 — nvidia · 2026-07-20
- NVIDIA推动创意软件接入MCP — nvidia · 2026-07-20
- NVIDIA 推进物理AI图形仿真 — nordicinst · 2026-07-20
- NVIDIA 推出合成视频检测服务 — nvidia · 2026-07-20
- NVIDIA 开放 Cosmos 3 Edge — liu_mingyu · 2026-07-21
- 【源头】NVIDIA 推出端侧世界模型 Cosmos 3 Edge — NVIDIAAI · 2026-07-21
- Cosmos 3 Edge 登顶视觉分析榜单 — NVIDIAAI · 2026-07-21
- NVIDIA 开放 Cosmos 3 Edge 全套资源 — NVIDIAAI · 2026-07-21
- NVIDIA推进物理世界生成与视频检测 — nvidia · 2026-07-21
- 【源头】NVIDIA 推出 Cosmos 3 Edge 与 DGX Station 开放 agent 栈 — nvidia · 2026-07-21
另有 5 条近重复转述:nvidia · nvidia · nvidia · CSProfKGD · liu_mingyu