ICML研讨会把人机共创拆成五项待做:指标、基准、多样性、署名、协同

Human-AI Co-Creativity: Advances, Opportunities, and Challenges

Adish Singla, Abhilasha Ravichander, Liwei Jiang, Alexander Spangher, Alice Oh, Jiho Jin, Jun Seong Kim, Changyoon Lee, Manh Hung Nguyen, Chao Wen

cs.CY

2026-09-08

这篇是ICML 2026人机共创研讨会综述:80篇投稿录用49篇,6场邀请报告。它把领域收成五项待做,没有新模型或新数字。

这篇在解决什么

生成模型已经进了设计、写作、科研构思的日常流程。机会很清楚:人可以拿模型当头脑风暴介质。代价同样清楚:输出同质化、设计固着、版权和署名说不清。ICML 2026 在首尔办了一场人机共创研讨会,组织者来自 MPI-SWS、华盛顿大学、斯坦福、KAIST。这篇文稿不是新方法,是把会场活动、录用论文和邀请报告收成一份方向图。

现有模型接口大多按「自动化」来设计。用在开放式创作上,人容易被模型的平均答案钉死,群体层面还会出现跨模型的「人工蜂群」效应:同一模型内部、不同模型之间都往一套说法上收。

方法

研讨会按两条轴组稿。第一条轴是生成模型如何撑开放式任务:分享现场经验、提高模型多样性、为共创重做架构、建评测。第二条轴是接入工作流之后的麻烦:设计固着、想法同质、真伪鉴定、署名与报酬。

审稿是双盲,8 名审稿人,每篇至少三审。共 80 篇投稿,录用 49 篇,非存档,海报加闪电讲。邀请报告 6 场,另有 60 分钟圆桌。报告覆盖面很杂:Zhao 讲生成内容合法化之前必须先处理的技术债和音乐流媒体里的 AI slop,以及用 Glaze 保护画风;Elliott 讲主流 AI 艺术里的原创性;Hong 主张工业设计从「把活交给模型」改成「编排多个智能体」,并故意加摩擦,比如让模型扮演幼稚徒弟来逼人思考;Chung 讲用后训练和用户模拟器把 LLM 从执行意图改成发现意图;Mehrotra 把创造力和学习看成同一类心智模型重建;van der Plas 讲计算创造力在 NLP 里仍被低估。

正文把录用论文和讨论收成五个方向:创造力指标、创意任务基准、提高生成多样性、真伪与署名、人机共创交互。

结果

没有新模型,也没有对照实验。能当结果看的是会场结构和它点名的缺口。

项目数字
投稿 / 录用80 / 49
审稿人 / 每篇评审8 / ≥3
邀请报告6×30 分钟
圆桌60 分钟
整理出的研究方向5 组

指标一节提醒:AUT、RAT、TTCT 是给人用的,高分低分并不能直接翻译成模型的创造能力;专家共识评分(Consensual Assessment Technique)更贴创作现场,但自动化对齐专家仍未做成。基准一节点出当前套件多停在组合式、探索式创造,对转换式创造和「人在环里」几乎没测。方法一节反复出现同一张力:后训练把正确率抬上去,输出多样性跟着塌。真伪一节把问题从「这是不是 AI 写的」推到过程级溯源:一次共创会话里谁贡献了什么、跨会话再混合之后如何记账。交互一节引用设计固着和过度依赖的证据,Hong 的处方是编排加故意摩擦,而不是再做一个更顺的自动补全。

为什么重要

做产品的人如果还在用 MMLU 式正确率衡量创作助手,这篇把错位点明了:用户真正拿模型做的事,评测几乎没覆盖。后训练多样性塌缩、跨模型同质化、检测器误伤非母语作者,都已经有文献,不是气氛讨论。对要做创作工具的人,可执行的判断是:单独把模型的「创意分」做高,未必能转化成人机共创变好;需要针对共创过程本身的基准和干预。

它是社区地图,不是可复现系统。读完不会多一个可跑的方法,但能看清这个子领域现在卡在评测、多样性和署名三件事上。

局限与存疑

材料来源是一场研讨会,不是系统综述。49 篇录用论文多数只列了标题,证据强度参差。五项「未来方向」是愿望清单,没有优先级,也没有失败案例的定量盘点。Zhao 关于音乐 AI slop、Jiang 关于 Artificial Hivemind 的判断都来自被引工作,本文没有复现。非存档工作坊论文随后可能大改或消失。组织者自己也是相关方向的作者,选题口径会偏向他们熟悉的指标和多样性训练。

术语

原文与代码

社区讨论

相关论文

全部论文解读