实测 Qwen Image 2.1 单提示词生成四视图角色表:44 角色 43 秒,构图仍不过关
HarnessLightnin · reddit · 2026-09-21
一个游戏美术实验室测试能否用 Qwen Image 2.1(7B DiT)的单一 T2I 前向,替代现有「H3 视频转台 + 姿态提取 + 拼接」的多阶段角色参考表流水线。
测试设置
- 单张 RTX 3090(24GB),40 步 Euler/Simple,CFG 5.0,固定种子
- 每张四格合成图约 46.7 秒,峰值显存约 14 GiB
- 批量测试 44 个角色(人类与自动机)
- 提示词策略:固定四象限布局与 1968 年摄影棚风格描述,只变换角色服装/机体;印刷/网点风格完全后处理,不占用扩散模型容量
成功项(44/44)
- 视图位置全部正确:特写左上、正面右上、背面左下、侧面右下,零错位
- 服装轮廓、配色、材质(抛光铬、蚀刻黄铜)在四视图间保持一致,无需参考图
- 单卡约 45 秒出全套,远快于多阶段流水线
失败项(人工终审)
- 部分角色全身比例被压缩成「侏儒化」:头大肢短
- 面板间相机距离漂移:侧视图明显更近,导致人体纵向压缩
- 全身取景越界:同一张里正面完整、背面裁到小腿、侧面裁到大腿中部
结论:提示词版 Qwen Image 2.1 目前无法替代其转台流水线——它能稳定摆好四视图并保持一致性,但纯文本提示无法可靠控制各面板的相机距离与全身取景边界。
「多模态」频道最新
- MiniMax H3 REF2VA 结尾失控:用户 300 次渲染仍难控制镜头落点 — bajungadustin · 2026-09-22
- Perplexity Computer 接入 MiniMax H3 与 Seedance 2.5 生成视频 — perplexity_ai · 2026-09-22
- 创意工作室实测 GPT-6 Astra:独立电影人的转折点还是局限明显? — danshipper · 2026-09-22
- 视频转 Blender 蜡笔工作流:AI 生成视频可自由改画重定时上色 — andrew_n_carr · 2026-09-22
- 普通用户实测:Qwen 2.1 色彩稳定,意外成优秀放大器 — skyrimer3d · 2026-09-22
- 一个 Grok 提示词把头像变成圆形刺绣徽章设计 — bennash · 2026-09-22