Dev predicts a universal DSL for video data will enable highly controllable world-simulation diffusion models

zeeshanp_ · x · 2026-09-30

Zeeshan Pishevar argues LLMs are now good enough to create videos via code, so video descriptions can be expressed in code too — building on prior practice of JSON-formatted synthetic captions for generative visual models. He predicts a universal DSL for video data will arrive soon, enabling diffusion models trained for extreme controllability in world simulations.

Original post →

More from Multimodal

Multimodal channel →