Authorship attribution and aesthetic evaluation of AI poetry: a case study with Haiku
Livia Oddi, Simone Scardapane, Toru Sugimoto, Donatella Genovese
cs.CL, cs.AI
2026-09-14
用few-shot让六款模型写日语定型俳句,144名东京大学生盲评作者。GPT-5识别率0.493;审美分预测「像人」AUC 0.793,预测真作者仅0.505。
此前对 AI 写诗的评估,大多走两条分开的路:一条打审美分,一条做作者识别。Hitsuwari 等人 2023 年已经发现,人机协作俳句的美评分最高,而且受试者分不清人和 AI。缺的是跨模型对照,以及一个更尖的问题:让一首俳句「看起来像人写的」那些线索,能不能同时让人把作者认对。
罗马大学与东京芝浦工业大学把测试场收窄到日语定型俳句:5-7-5 音拍、必须带季语(kigo,季节词)。约束够硬,六款模型才能在同一套规则下比;读者也落在日本大学生身上,不是拿英文诗做外评。
生成侧没用微调。初步实验里 Optuna 加 LoRA 把训练损失压得很低,模型却在背 5-7-5 模板,泛化不出来。闭源模型也无法放进同一套微调框架。最终统一用日语 few-shot:每条 prompt 嵌 6 首带季语、季节、结构标注的范例,要求三行、5-7-5、至少一个季语,不许出现拉丁字母和数字。
身份句的措辞有实测差别。「你是日语的俳人」比更地道的「你是日本人的俳人」更好:StableLM-7B 的平均困惑度从约 52 降到 34,Gemma-2B 从约 6975 降到 530。训练数据里更常见的是「用日语做 X」这种指令。解码用逐行采样(temperature 0.7,top-p 0.90),不用 beam search,因为 beam 会把 few-shot 里的 n-gram 抄回来。
六款模型覆盖开源闭源、体量和日语专化程度:
每模型每季至少留下 3 首合格作,共 72 首 AI 俳句;对照是当代征稿获奖的 12 首人类俳句。约束通过率差很大:LLM-JP 和 Gemini 2.5 是 100%,GPT-5 是 91.7%,StableLM-7B 只有 62.5%。
评测发给东京多所大学 144 名学生,多数母语者,人文和理工都有。12 套问卷各 12 首(6 首 AI + 6 首人,随机打乱),每套 12 人。每首打 7 个 1-5 分:流畅、俳句用语、诗意、跨行连贯、可理解、好感、意外性,再猜作者并报把握。分析用 L2 逻辑回归和贝叶斯二项混合模型,随机截距交叉在受试者和诗上。
识别准确率按模型裂开:
| 模型 | 识别准确率 | 判定 |
| GPT-5 | 0.493 | 随机水平 |
| Gemini 2.5 | 0.503 | 随机水平 |
| StableLM-7B | 0.524 | 随机水平 |
| LLM-JP | 0.590 | 中等可辨 |
| Gemma-2B | 0.611 | 中等可辨 |
| LLaMA-2 | 0.670 | 最容易被认出 |
GPT-5 的混淆几乎对称:人类作被判成人 75、判成 AI 69;AI 作被判成人 77、判成 AI 67。LLaMA-2 则两边都更能认对(人类正确 100、AI 正确 93)。84 首独立俳句的识别率分布很宽,一部分低于随机,可辨性主要跟单首风格有关,不是稳定的模型指纹。
七维印象分大多落在 3-4 分。流畅、俳句用语、连贯最高;意外性最低,靠近量表中点。人和 AI 的平均印象分接近。把握分往往更低:诗写得像样,作者仍说不准。
背景变量几乎解释不了识别力。完整回归交叉验证 AUC 0.416,只留日语水平 0.456,去掉语言 0.432,都在随机附近。日语非母语者识别更差一些;理工科相对人文略好,论文自己标成探索性,没测过对生成工具的熟悉度。
真正裂开的是「猜对」和「觉得像人」。用印象分预测是否认对作者,交叉验证 AUC 只有 0.505。好感越高,认对的几率越低(OR = 0.83)。同一组分数去预测「被判成人类」,AUC 升到 0.793:好感 OR = 1.72,俳句用语 OR = 1.36,主题贴合 OR = 1.33。附录里 Grok 做裁判时,把 GPT-5、Gemini 2.5、StableLM-7B 的全部样本都标成人类,准确率也是 50%。
审美线索驱动的是归因启发式,不是诊断信号。
对做创意生成评测的人,这是一个测量学警告。Turing 式「分不清」不能当成创造力证据;这篇也没把它当证据。更麻烦的是,人打的美、像俳句、主题贴合,会系统性把作品推向「像人写的」,即使来源是 GPT-5。用审美问卷给模型排创造力名次,排到的可能是归因偏见。
对产品侧也有直接含义。在约束极强的短文本上,前沿闭源模型和部分日语开源模型已经把人类识别压到随机。想靠读者「一眼看出 AI 味」做内容治理,在俳句这种体裁上已经不够用。开源小模型仍有可辨空间:ELYZA 的 Llama-2 7B 约三分之二被认出来,StableLM-7B 还丢掉 37.5% 的候选。能写出合格的 5-7-5,和写到让母语者认不出,不是同一件事。
这是渐进证据,不是新任务。Hitsuwari 2023 已经报过「分不清」。贡献在于把裂隙钉在六个当代模型和一套可复现的 few-shot 管线上:审美预测「像人」(AUC 0.793),几乎预测不了真作者(AUC 0.505)。
论文自己列得很清楚。场景锁在 few-shot 日语定型俳句,推不到自由诗或别的艺术门类。受试者是 144 名东京高校学生,不是日本一般读者。人类对照全是当代征稿获奖作,故意避开了劣质人类样本,但也把对照抬到了当代俳句的高位子集,AI 要混进的是竞赛赢家,不是平均水平。六款模型、同一套 prompt 和采样设置,换解码或换版本数字会动。统计是探索性的,若干 AUC 贴着随机,样本也不大。
问卷每套都是 6 首 AI 对 6 首人,受试者事先知道两种都有,基率被钉在 50%。真实阅读里 AI 占比不是一半。StableLM-7B 约束通过率只有 62.5%,进入问卷的是过了门的合格作,评的不是平均产出;这批合格作仍掉到随机。Grok 裁判每模型 12 首,不能当检测器指标。