开发者预言:通用视频描述 DSL 将催生可控世界模拟模型
zeeshanp_ · x · 2026-09-30
Zeeshan Pishevar 提出一个方向性判断:LLM 已强到可以用代码生成视频,因此视频内容的描述本身也可以用代码表达。视觉生成模型过去已有用 JSON 格式合成字幕的做法,他预测离「用通用 DSL 描述视频数据」不远,这类结构化描述可用于训练扩散模型,从而获得对世界模拟的极端可控性。
「多模态」频道最新
- Dolphin AI 发布:主打多镜头一致性的 agentic 视频制作工作室 — thetripathi58 · 2026-09-30
- 开源框架 Dioramas 免费发布:Nano Banana 2+Meshy 生成 3D 官网,含 20 个示例 — Scobleizer · 2026-09-30
- Niantic Spatial 演示:用高保真高斯泼溅几小时做出实景短片 — Scobleizer · 2026-09-30
- SKF 广告用 AI 复活 Greta Garbo,卫报影评人狠批乏味数字还魂 — nordicinst · 2026-09-30
- RTX Pro 6000 跑满配 MiniMax H3:一段 15 秒视频生成 26 分钟、峰值 62GB 显存 — Realistic-Fennel-190 · 2026-09-30
- VideoLoop 用循环工作记忆治「语义抖动」,VideoMME 长视频达88.3% — Jinfa Huang · 2026-09-30