哈佛实测:多模态 LLM 评图像创造力,与人类相关性达 0.68
DynamicWebPaige · x · 2026-08-15
一篇来自哈佛与宾州州立大学的 arXiv 新论文(编号 2606.29672)研究了多模态 LLM 能否零样本充当图像创造力评委——即不做任何微调、不给人类评分示例,直接给作品的原创性打分。发帖人调侃:看完模型们辛辣的点评,都不敢让 Gemini 或 Claude 评价自己的画了。
研究设计
- 测试 6 个多模态模型:Gemini 3 Flash、Gemma 4 31B IT、GPT-5.4 Mini、GLM-5v Turbo、Kimi K2.5、Qwen 3.6 Plus
- 数据集:992 张按人类提示词生成的 AI 图像,以及 1500 幅已有人类创造力评分的手绘草图
主要发现
- 研究 1:所有模型都与人类创造力评分显著相关——AI 图像上 r = .57–.68,草图上 r = .29–.68,说明 LLM 基本能当好"艺术评委"
- 研究 2:分析其中 3 个模型的逐步推理链发现,推理让评价过程可解释(模型关注什么、如何权衡原创性与质量、如何给出扣分理由),但并没有提升与人类评分的一致性
模型点评的风格相当毒舌,例如:"它不只是'一个带眼睛的圆锥',而是一个有故事的完整场景";也会因"拟人化物体是 AI 艺术的已知套路"而扣分——被发帖人称为绝佳的睡前读物。
所属事件:研究称多模态大模型可零样本胜任图像创造力评委(2 条相关)→
「研究」频道最新
- Insilico 推出虚拟衰老细胞平台,引入时间维度建模 — MaxUnfried · 2026-08-15
- 《AI 数理基础》书籍发布,带 AI 导师功能 — burkov · 2026-08-15
- NSF 2000 万美元建全美首个 AI 蛋白质工程云实验室 — MichaelCJewett · 2026-08-15
- GPU 程序搜索难在搜索空间巨大,需降维至抽象表示 — spikedoanz · 2026-08-15
- DeepSeek 论文解析:LH 任务与 Harness 元微调 — EstablishmentOdd785 · 2026-08-15
- 斯坦福虚拟胚胎挑战赛首周吸引401名研究者,295支团队参与 — anshulkundaje · 2026-08-15