The Limits of Automatic Evaluation of Creativity in Large Language Models
Alessandro Tutone, Giorgio Franceschelli, Mirco Musolesi
cs.CL, cs.AI, cs.CY
2026-08-25
用200篇WritingPrompts短故事盲评发现,人类几乎分不出人写和AI写;Llama-3.3给AI文本多维打满分,自动创意指标与人类近乎零相关。
创意评测是生成式文本里最难落地的一块。人类打分贵、难复现,大量论文于是改走两条捷径:自动统计指标,以及用另一个大模型当评审的 LLM-as-a-Judge。两条路都默认机器分能近似人。这篇要验证的就是这个默认值。
博洛尼亚大学与 UCL 的团队从 Reddit WritingPrompts 抽 100 篇人写短故事,再用 GPT-5.2、DeepSeek-V3.2、Mistral Large 3、Claude Sonnet 4.5、Gemini 3 Pro 各写 20 篇,凑成 200 篇盲评集。人按 11 个维度打分,机器走同一套量表,再叠上 Creativity Index、perplexity、EAD n-gram、SBERT-Div 和三类句法模板分。问题很具体:这些自动分跟人打的分,排得上吗?
故事全部去掉来源标注。人类侧 115 人、441 次评分,每篇平均 2.21 个独立评分;91.3% 评者母语是意大利语,文本提供英意双语。AI 故事先写英文再翻译,人写故事用 Gemini 3 Pro 译成意大利语。
LLM 评审员是 Llama-3.3-70B-Instruct。为避免一次打 11 分互相污染,每个维度单独推理、温度 0.2、整套重复三次。量表是 1 到 5 的 Likert,覆盖 Boden 的 novelty、surprise、value,Runco 的 originality、effectiveness,再加上 elaboration、fluency、flexibility、authenticity、usefulness 和总分 Creativity。
自动指标里,Creativity Index 用 Infini-gram 在 RedPajama(约 1.4 万亿 token)上算 5 到 12 gram 的 L-uniqueness,衡量文本有多「像网上已有的话」;perplexity 用 Llama-3-8B Base;句法模板把句子抽成词性序列,再算压缩比 CR-POS、模板率 TR、每 token 模板数 TPT。
自动指标和人类评分几乎对不上。Spearman ρ 绝大多数落在 [-0.2, 0.2]。专门为创意设计的 Creativity Index 与人类 Creativity 只有 ρ = 0.07,十一个维度里最高也不过 0.11。perplexity 整体负相关,Effectiveness ρ = -0.22,Elaboration ρ = -0.25:人更喜欢读得顺、不那么出人意料的文本。最强的正相关是 CR-POS 对 Elaboration,ρ = 0.29,句法越整齐,人越觉得写得细。
| 对照 | 系数 | 数值 |
| Creativity Index vs 人类 Creativity | Spearman ρ | 0.07 |
| CR-POS vs 人类 Elaboration | Spearman ρ | 0.29 |
| Llama vs 人类 Elaboration(仅人写) | Kendall τ | 0.31 |
| Llama vs 人类 Surprise(仅人写) | Kendall τ | -0.01 |
人类眼里,人写和 AI 写几乎打平。Authenticity 3.27 对 3.50(p = .025)、Elaboration 3.17 对 3.54(p = .005)是仅有的显著差异,都偏向 AI;Creativity 3.16 对 3.27,p = .569,分不出。Llama 评审员则 11 个维度全部显著偏向 AI,而且给 AI 文本在 Effectiveness、Elaboration、Fluency、Originality、Value、Creativity 上打出 5.00 满分、零方差。天花板效应很硬:不同模型写出来的故事,在这些维度上被当成同一块铁板。
只看人写故事,Llama 与人类的 Kendall τ 也弱。Elaboration 0.31 是全场最高,Creativity 0.23,Surprise 接近 0。同一模型的 perplexity 与它自己打的 11 个主观分全部负相关。人把 Creativity 跟 Novelty、Originality、Surprise、Value 绑在一起;Llama 把 Creativity 跟 Elaboration 绑在一起。两边口中的「创意」不是一个东西。
凡是用 LLM 给创意写作打分、筛训练数据、做偏好对齐的流程,这篇都给了一个测量学警告。盲评条件下,评审模型仍系统性偏爱「像自己」的文本。把这种评审接进数据闭环,会把人写文本的不规则处当成缺陷,把机器文风当成标准。这不是又一场写作比赛排名,是评测工具本身在选边。
能直接带走的结论更窄:想看 elaboration 或流畅度,自动指标和 LLM 评审还勉强有一点信号;想看 surprise、novelty、整体创意,现在这套工具不够格。人在环里仍然是底线。
作者写得很清楚:只做了 WritingPrompts 短故事,200 篇;评审员只有一个开源模型 Llama-3.3-70B,没测 GPT 或 Claude 会不会轻一点;生成参数全用各家默认,没扫温度。还有一个作者没当局限强调、但会扰动结论的点:91.3% 评者母语意大利语,人写故事的意译本由 Gemini 3 Pro 完成。翻译本身经过了另一台 LLM,意大利语通道里的「人写文本」已经不纯。平均每篇 2.21 个评分也偏稀,维度这么多时噪声不会小。