LLM评审员给AI故事打满分,人类几乎分不出谁写的

The Limits of Automatic Evaluation of Creativity in Large Language Models

Alessandro Tutone, Giorgio Franceschelli, Mirco Musolesi

cs.CL, cs.AI, cs.CY

2026-08-25

用200篇WritingPrompts短故事盲评发现,人类几乎分不出人写和AI写;Llama-3.3给AI文本多维打满分,自动创意指标与人类近乎零相关。

这篇在解决什么

创意评测是生成式文本里最难落地的一块。人类打分贵、难复现,大量论文于是改走两条捷径:自动统计指标,以及用另一个大模型当评审的 LLM-as-a-Judge。两条路都默认机器分能近似人。这篇要验证的就是这个默认值。

博洛尼亚大学与 UCL 的团队从 Reddit WritingPrompts 抽 100 篇人写短故事,再用 GPT-5.2、DeepSeek-V3.2、Mistral Large 3、Claude Sonnet 4.5、Gemini 3 Pro 各写 20 篇,凑成 200 篇盲评集。人按 11 个维度打分,机器走同一套量表,再叠上 Creativity Index、perplexity、EAD n-gram、SBERT-Div 和三类句法模板分。问题很具体:这些自动分跟人打的分,排得上吗?

方法

故事全部去掉来源标注。人类侧 115 人、441 次评分,每篇平均 2.21 个独立评分;91.3% 评者母语是意大利语,文本提供英意双语。AI 故事先写英文再翻译,人写故事用 Gemini 3 Pro 译成意大利语。

LLM 评审员是 Llama-3.3-70B-Instruct。为避免一次打 11 分互相污染,每个维度单独推理、温度 0.2、整套重复三次。量表是 1 到 5 的 Likert,覆盖 Boden 的 novelty、surprise、value,Runco 的 originality、effectiveness,再加上 elaboration、fluency、flexibility、authenticity、usefulness 和总分 Creativity。

自动指标里,Creativity Index 用 Infini-gram 在 RedPajama(约 1.4 万亿 token)上算 5 到 12 gram 的 L-uniqueness,衡量文本有多「像网上已有的话」;perplexity 用 Llama-3-8B Base;句法模板把句子抽成词性序列,再算压缩比 CR-POS、模板率 TR、每 token 模板数 TPT。

结果

自动指标和人类评分几乎对不上。Spearman ρ 绝大多数落在 [-0.2, 0.2]。专门为创意设计的 Creativity Index 与人类 Creativity 只有 ρ = 0.07,十一个维度里最高也不过 0.11。perplexity 整体负相关,Effectiveness ρ = -0.22,Elaboration ρ = -0.25:人更喜欢读得顺、不那么出人意料的文本。最强的正相关是 CR-POS 对 Elaboration,ρ = 0.29,句法越整齐,人越觉得写得细。

对照系数数值
Creativity Index vs 人类 CreativitySpearman ρ0.07
CR-POS vs 人类 ElaborationSpearman ρ0.29
Llama vs 人类 Elaboration(仅人写)Kendall τ0.31
Llama vs 人类 Surprise(仅人写)Kendall τ-0.01

人类眼里,人写和 AI 写几乎打平。Authenticity 3.27 对 3.50(p = .025)、Elaboration 3.17 对 3.54(p = .005)是仅有的显著差异,都偏向 AI;Creativity 3.16 对 3.27,p = .569,分不出。Llama 评审员则 11 个维度全部显著偏向 AI,而且给 AI 文本在 Effectiveness、Elaboration、Fluency、Originality、Value、Creativity 上打出 5.00 满分、零方差。天花板效应很硬:不同模型写出来的故事,在这些维度上被当成同一块铁板。

只看人写故事,Llama 与人类的 Kendall τ 也弱。Elaboration 0.31 是全场最高,Creativity 0.23,Surprise 接近 0。同一模型的 perplexity 与它自己打的 11 个主观分全部负相关。人把 Creativity 跟 Novelty、Originality、Surprise、Value 绑在一起;Llama 把 Creativity 跟 Elaboration 绑在一起。两边口中的「创意」不是一个东西。

为什么重要

凡是用 LLM 给创意写作打分、筛训练数据、做偏好对齐的流程,这篇都给了一个测量学警告。盲评条件下,评审模型仍系统性偏爱「像自己」的文本。把这种评审接进数据闭环,会把人写文本的不规则处当成缺陷,把机器文风当成标准。这不是又一场写作比赛排名,是评测工具本身在选边。

能直接带走的结论更窄:想看 elaboration 或流畅度,自动指标和 LLM 评审还勉强有一点信号;想看 surprise、novelty、整体创意,现在这套工具不够格。人在环里仍然是底线。

局限与存疑

作者写得很清楚:只做了 WritingPrompts 短故事,200 篇;评审员只有一个开源模型 Llama-3.3-70B,没测 GPT 或 Claude 会不会轻一点;生成参数全用各家默认,没扫温度。还有一个作者没当局限强调、但会扰动结论的点:91.3% 评者母语意大利语,人写故事的意译本由 Gemini 3 Pro 完成。翻译本身经过了另一台 LLM,意大利语通道里的「人写文本」已经不纯。平均每篇 2.21 个评分也偏稀,维度这么多时噪声不会小。

术语

原文与代码

社区讨论

相关论文

全部论文解读