LLM 评审员系统性偏爱 AI 生成故事,自动创意评测几近失效
mircomusolesi · x · 2026-08-26
Mirco Musolesi 等人发布新预印本《The Limits of Automatic Evaluation of Creativity in Large Language Models》。研究团队在 WritingPrompts 数据集上收集了人类对人类与 AI 生成短篇小说的评价,覆盖 11 个创意维度,并与自动客观指标、LLM-as-a-Judge 评估结果对比。
实验发现自动评估与人类判断存在严重错位:LLM 评审员系统性地偏爱 AI 生成的故事,偏好其文风特征而非人类作品中的不可预测性等特质;相关性分析显示,广泛使用的自动指标与人类判断的相关性接近于零。论文指出,将多维、主观的创意压缩为计算指标存在根本性局限。
「研究」频道最新
- 探索工作与游戏的界限,本周 WebGPU 与 Strudel 创意编程汇总 — generatecoll · 2026-08-26
- AAAI会议演讲视频上线:智能体的"能动性"到底在哪里 — AnnaCiaunica · 2026-08-26
- 阿里开源电商智能体基准:107 真实任务,顶尖模型失败率超 40% — iamfakhrealam · 2026-08-26
- 阿里提出 DREAM:工业推荐系统的元控制层 — alibabagroup · 2026-08-26
- 研究提示工程技术在 GPT/Qwen/Mistral 新旧模型中的失效 — kalyan_kpl · 2026-08-26
- 长任务成功率翻倍:阿里MEA循环如何根治上下文腐烂 — 大模型之路 · 2026-08-26