LLM 新框架 CinemaTraj:用语言规划 3D 场景电影级镜头轨迹
joemeno · x · 2026-08-02
慕尼黑工业大学与华为德累斯顿研究中心联合提出 CinemaTraj 框架,将相机轨迹规划重构为语言引导的空间推理问题。给定 RGB-D 图像和用户提示,LLM 智能体借助结构化 3D 场景图,将提示分解为一系列原子电影运镜(推拉、环绕、升降、摇移、倾斜、变焦、弧线),并通过参数化轨迹表示实现碰撞避免。该框架可生成带同步旁白和字幕的电影化视频,应用于房地产广告、虚拟导览等场景。论文已被 ACM Multimedia 2026 接收。
「多模态」频道最新
- MiniMax H3 视频生成成本仅竞品三分之一,价格战重塑创作工作流 — FellMentKE · 2026-08-02
- 提示词拆解:用复古手机视角生成以假乱真的猫咪自拍 — Impressive_Patient19 · 2026-08-02
- ComfyUI v0.29.0 文本生成节点现 Bug,Gemma 输出异常 — jjjnnnxxx · 2026-08-02
- 字节跳动推 Dreamina:赋予创作者更高控制权的 AI 视频工具 — aftahi_ai · 2026-08-02
- Seedance 2.5 提示词指南泄露:详解参考角色与音频语法 — LaillaElgohary · 2026-08-02
- 中国 AI 视频模型以假乱真,成功误导法国新闻媒体 — beechinour · 2026-08-02