实测 GPT-5.6 艺术指导与情感表达远超 Gemini
ProxyLumina · reddit · 2026-08-20
作者通过创建虚构角色的详细世界观(10+ 文件),测试多模态模型在通过图像传达角色内心世界和艺术指导方面的能力。工作流涉及读取大量 Token(单次 15 万)并迭代生成图像。
对比结论:
- GPT-5.6 (Luna/Terra/Sol):即使在 Medium 设置下,也能深入理解角色内心世界,并严格遵循艺术指导生成高质量构图。
- Gemini 3.5/3.6/3.7 Flash:在 High 设置下仍难以深入理解角色复杂性,无法有效遵循艺术指导。
作者认为 GPT-5.6 在通过图像传递情感和复杂关系方面远超 Gemini。
「多模态」频道最新
- 超详细 Prompt:生成蟑螂电台主播 3D 角色设定图 — CurieuxExplorer · 2026-08-20
- AI 生成电影预告片 RETROGRADE 展示 — dougsinc · 2026-08-20
- Midjourney 单词提示词挑战:仅用“chimera”生成嵌合体 — tisch_eins · 2026-08-20
- LM Arena 测试新图像模型 luna-lisa-alpha — koltregaskes · 2026-08-20
- Midjourney 粗粝美学:拼贴情绪板+超写实参数 — Ror_Fly · 2026-08-20
- 全程仅用 Adobe Firefly 制作了虚构品牌鞋履广告 — LudovicCreator · 2026-08-20