复旦联合港中大发布首个 Agentic 视觉生成综述,按决策范围划分 L0-L4
jiqizhixin · x · 2026-10-01
复旦大学万团队联合港中大 MMLab 发布首篇 Agentic Visual Generation 综述,回应视觉生成正从「输入提示词、输出图像」转向系统自主决定生成什么、执行中选工具、根据结果迭代并保留经验的趋势。
- 综述以控制器的决策范围为核心构建分类框架,把系统从 L0 到 L4 分级,按控制器能影响的最远决策划分
- 统一覆盖图像生成、编辑、视频、幻灯片、用户界面、3D 与世界模型,用同一组问题审视:生成前能决定什么、执行中能选什么、看到结果后能改什么、任务结束后能保留什么
- 关键发现:当前系统在各决策维度上的自主性参差不齐,领域缺乏「一条生成管线到哪里结束、agent 从哪里开始」的共享语言
「多模态」频道最新
- AI 短短几天掀翻多个行业:游戏史视频、VR 模组媲美大厂出品 — Dr_Singularity · 2026-10-01
- 博主用 Grok 与 Suno 制作马斯克传记影片,附可玩 Blastar 游戏 — EricBuess · 2026-10-01
- Runway AI 峰会开幕:联合 CEO 主讲通用世界模拟器愿景 — runwayml · 2026-10-01
- Gemini 4 Pro 一条提示把苍蝇变成瑞士名表级奢侈品,7 分钟出片 — cgarciae88 · 2026-10-01
- 全用 Adobe Firefly 生成睡前故事:插画、动画、配乐、旁白一站式完成 — LudovicCreator · 2026-10-01
- 写给最后一代手写代码者的歌:全帧代码生成的 MV — Relevant-Student-468 · 2026-10-01