Qualcomm VP on T2I's next frontier: RL for identity diversity and decoupled generation pipelines
机器之心 · wechat · 2026-09-05
机器之心整理了高通技术副总裁 Fatih Porikli 的访谈,聚焦图像生成从「看起来好」走向「精确可控」的技术路径。
核心问题:现有 T2I 模型在多人身份混淆、复杂空间构图、超高分辨率显存爆炸等方面存在系统性缺陷,难以进入影视预演、广告设计等专业工作流。
团队在 CVPR 提出的方案:
- Disco:用强化学习(GRPO)微调基础模型,将「图内多样性」与「跨次多样性」作为优化目标,独特面孔准确率达 98%-99%,并发布 DiverseHumans 基准。
- Ar2Can:借鉴人类艺术家「先构图后渲染」的思路,将生成解耦为 Architect(结构化布局规划,含 Qwen 边界框预测与 RL 调优的 Flux-Schnell 姿态规划两个变体)和 Artist(基于 GRPO 与组合奖励的逼真合成)两阶段,人数准确率 90.2%、多身份相似度 68.2%,均超对比方法。
- PixelRush 与 InvertFill:分别在超高分辨率生成与图像编辑质量上突破潜空间操作的物理极限。
Porikli 认为图像生成将走向「Agentic」管线:不再依赖单一巨型模型,而是按提示词特征路由给处理多样性、文本渲染或特定风格的专家模型,通过编排实现最优输出。
More from Multimodal
- Generative AI point-and-click detective game built without a multimillion-dollar budget — tristanbob · 2026-09-06
- A sugar cube containing a full kitchen: the impossible-geometry video prompt, in full — umesh_ai · 2026-09-06
- Redditor Shares an AI-Generated Action Short Film — Ok-Vegetable-2455 · 2026-09-06
- Astra recreates Agamemnon's helmet in 3D, outputting GLB and Blender files in 9 minutes — eigenron · 2026-09-06
- 800 photos recreate a 220-year-old Japanese inn in 3DGS using LichtFeld exposure correction — janusch_patas · 2026-09-06
- Swapping Faces in Hailuo Videos: One Character Works, Two-Character Fights Fall Apart — MIRIVUM · 2026-09-06