长提示词反伤画质?研究称文生图更依赖场景结构

eyishazyer · x · 2026-08-05

一项研究发现,在文本生成图像任务中,提示词的结构比长度更重要。图像生成模型受限于提示词对场景描述的清晰度,而非单纯的 token 数量。

实验表明,随着自然语言描述的变长,开源模型生成的图像质量最终反而会劣化,甚至不如使用最短描述时的生成效果。文本条件的有效性更多取决于与图像相关的实质性信息。

所属事件:研究称文生图更依赖场景结构而非提示词长度(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →