Google 发布多智能体框架,生成长视频不再人设漂移
AI_Andrew · x · 2026-09-25
Google Research 发布「AI 视频联合导演」:一个统一的多智能体框架,在 Gemini 与 Veo 之上构建编排层,自主生成时间一致的长篇视频叙事。
- 解决的问题:现有链式 agentic 流水线因各模块独立手工提示,存在语义漂移(角色服装/场景跨镜头渐变)、级联失败(上游资产瑕疵污染下游合成)与内容塌缩(叙事不推进)。
- 方法思路:把长视频生成视为全局优化与世界状态追踪问题,显式规划多镜头视觉连续性,缓解传统流水线的 credit assignment 困难。
- 安全:原生继承 SynthID 水印等安全机制。
相关套件包括 CANVAS、A²RD、VQQA 等子框架。
「多模态」频道最新
- BuildingBench 榜单易主:Opus 5.5 得 86.8,成本是竞品 6 倍 — ZhitingHu · 2026-09-25
- 视频模型为何违反物理?去噪前 10% 已锁死轨迹 — linoy_tsaban · 2026-09-25
- Gemini 3.8 Flash 可按文字/视频/图片生成 MIDI 导入 GarageBand — DynamicWebPaige · 2026-09-25
- Claude Code 执导「史上最无聊电影」,总成本仅 $16.87 — Greedy-Giraffe-4269 · 2026-09-25
- Qwen-Image-2.1 Edit 被指总照搬参考图人脸,难以融合身份 — Real-Bed-1815 · 2026-09-25
- 谷歌 Gemini 3.8 Live 推 Live Avatar,AI 对话有了实时口型脸 — The Verge AI · 2026-09-25