高通VP谈图像生成困局:RL提升可控性、解耦架构冲破分辨率极限
机器之心 · wechat · 2026-09-05
机器之心整理了高通技术副总裁 Fatih Porikli 的访谈,聚焦图像生成从「看起来好」走向「精确可控」的技术路径。
核心问题:现有 T2I 模型在多人身份混淆、复杂空间构图、超高分辨率显存爆炸等方面存在系统性缺陷,难以进入影视预演、广告设计等专业工作流。
团队在 CVPR 提出的方案:
- Disco:用强化学习(GRPO)微调基础模型,将「图内多样性」与「跨次多样性」作为优化目标,独特面孔准确率达 98%-99%,并发布 DiverseHumans 基准。
- Ar2Can:借鉴人类艺术家「先构图后渲染」的思路,将生成解耦为 Architect(结构化布局规划,含 Qwen 边界框预测与 RL 调优的 Flux-Schnell 姿态规划两个变体)和 Artist(基于 GRPO 与组合奖励的逼真合成)两阶段,人数准确率 90.2%、多身份相似度 68.2%,均超对比方法。
- PixelRush 与 InvertFill:分别在超高分辨率生成与图像编辑质量上突破潜空间操作的物理极限。
Porikli 认为图像生成将走向「Agentic」管线:不再依赖单一巨型模型,而是按提示词特征路由给处理多样性、文本渲染或特定风格的专家模型,通过编排实现最优输出。
「多模态」频道最新
- 用 Minimax H3 玩转图片+音频生成视频,实测 Sol-attn — Organic-Thought8662 · 2026-09-06
- MiniMax H3 电影感剪辑实测:「Coffee」视频效果展示 — Jeffu · 2026-09-06
- 博主用 GPT 6 Astra 2 小时做出 3D 钢琴手,琴指真的跟着音符弹 — nptacek · 2026-09-06
- Midjourney 8.2 两个新 sref 风格码,附完整出图参数 — michaelrabone · 2026-09-06
- 40 次实测摸清 Trellis.2 双简化器:Cumesh+Meshlib 串联才是最优解 — Tamerygo · 2026-09-06
- 北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral — jiqizhixin · 2026-09-06