LLM 评审员系统性偏爱 AI 生成故事,自动创意评测几近失效

mircomusolesi · x · 2026-08-26

Mirco Musolesi 等人发布新预印本《The Limits of Automatic Evaluation of Creativity in Large Language Models》。研究团队在 WritingPrompts 数据集上收集了人类对人类与 AI 生成短篇小说的评价,覆盖 11 个创意维度,并与自动客观指标、LLM-as-a-Judge 评估结果对比。

实验发现自动评估与人类判断存在严重错位:LLM 评审员系统性地偏爱 AI 生成的故事,偏好其文风特征而非人类作品中的不可预测性等特质;相关性分析显示,广泛使用的自动指标与人类判断的相关性接近于零。论文指出,将多维、主观的创意压缩为计算指标存在根本性局限。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →