GAN的“错误”为何更艺术?长文反思扩散模型的语义瓶颈

Imaginary_Bit9621 · reddit · 2026-08-08

一位开发者耗时8个月利用1万多幅公共领域历史画作训练GAN模型,用于生成适合打印装裱的装饰画。作者发现,现代主流文本生成图像模型(如Diffusion)虽然画面极其干净逼真,但往往“过于完美”,缺乏让人反复咀嚼的视觉深度。

作者的朋友认为主流模型已足够强大,只需反推提示词就能轻易复刻GAN的效果。然而实验证明,反推提示词会将图像中模糊的视觉模式强制具象化(例如把似是而非的形状定义为“悬崖”),再喂给模型后,生成的只是符合定义的普通悬崖。作者将这一现象称为“语义瓶颈”:文本条件模型受限于语言的精确性,而GAN不依赖文本指令,反而能生成那些大脑需要主动去解读的、模棱两可的艺术感图像。

所属事件:开发者反思扩散模型语义瓶颈:GAN更适合实体艺术(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →