开发者预言:通用视频描述 DSL 将催生可控世界模拟模型

zeeshanp_ · x · 2026-09-30

Zeeshan Pishevar 提出一个方向性判断:LLM 已强到可以用代码生成视频,因此视频内容的描述本身也可以用代码表达。视觉生成模型过去已有用 JSON 格式合成字幕的做法,他预测离「用通用 DSL 描述视频数据」不远,这类结构化描述可用于训练扩散模型,从而获得对世界模拟的极端可控性。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →