An Embodied Companion for Visual Storytelling
Patrick Tresset, Markus Wulfmeier
cs.HC, cs.AI, cs.GR, cs.RO
2026-01-18
四轴画笔机器人接Gemini工具调用,与人对纸讲故事。七位艺术专家给审美身份打6.0/7,机器意图感最低4.71。
Patrick Tresset 做了十五年会自己落笔的绘画机器人。最初的动机是把自己从执行里拿开,看机器单独能画出什么。画面整齐,却缺人的经历带出来的意思。后来一位策展人点破缺口:艺术家本人不在场。
EACVA 项目里,他和 Google DeepMind 的 Markus Wulfmeier 把方向拧过来:把人的手重新放进执行过程。Companion 不是再做一个自动画师,也不是文生图再拿机械臂描一遍。它是一台会说话、会看纸、会用工具调用下笔的 Gemini 代理,跟人对着一张 170×130 mm 的纸轮流讲故事。
硬件是自制四轴平面臂(肩、肘、腕、抬笔),Dynamixel 舵机。精度故意不高。间隙、柔顺、机架弹性被当成风格来源,速度一变,线质就变。视觉是 Logitech C920 加云台。交互几乎全靠说话:把肩关节转大约 10 度开始录音,静音自动停;人在纸上加了线,就转相机拍照。底层用比 ROS 更轻的 YARP。
智能层是 Python 代理接 Gemini API。系统指令把人格钉成「爱讲故事的绘画机器人」:人用火柴人,有机物用样条,允许轻微不对称,加粗就偏一点重描。模拟画布 1200×900 像素,新元素要留 40 像素空隙,免得叠在一起。
下笔不走 SVG。他们试过让模型出矢量路径,风格太可预期。改成一组过程性工具:涂鸦填充、排线、圆、线段、Hershey 字体、三次样条,还有沿中心样条抖动的乱线。模型 function calling,参数进绘图系统再变成机械臂路径。
风格靠 In-Context Learning 灌进去。24 张手绘草稿,每张配一段 Gemini 自己写的「怎么大概画」。附录消融很清楚:只给图、不给画法,输出碎、怪,模型看见了却不会翻译成工具序列;图加画法一起给,它会把「底下排线当地面」「有机体用曲线」这类动作语法推到没见过的对象上。论文把这叫 procedural style transfer。方法写得太细,机器人反而变僵。
语音合成用 gTTS 或 eSpeak,语言参数设成法语或西班牙语去读英文,弄出一口非母语口音,拉开和客服式助手的距离。
评估走艺术圈的 Consensual Assessment Technique。七位专家(五位职业策展人、一位藏家、一位用机器人的艺术家)看作品集和交互录像,1–7 打分。他们都熟悉 Tresset 以前的绘画机器人,所以打的是 Companion 这套新系统,不是「机器人能画画」这件事本身。
| 维度 | 均分 | 备注 |
| Aesthetic Identity | 6.0(SD 0.81) | 最高,组内一致性 rwg=0.67 |
| Originality | 5.86 | |
| Global Quality | 5.71 | 专家认为够办展 |
| Conscious Presence/Intent | 4.71(SD 1.11) | 最低,分歧也最大 |
专家把风格比成史前岩刻、Paul Klee、Basquiat。一位策展人说作者身份「感觉是共享的,不是简单委派」。
角色实验是定性的。当「艺术总监」时,机器人会听话加衣服和帽子,也会拒绝用虚线箭头表示时间;有一次不把人物换位去接羽毛,直接画了一条特别长的胳膊。当插画师时,《龟兔赛跑》词表里没有龟和兔,仍画得出:乌龟重复六次、兔子三次、右边竖线是终点、最后一只兔子被涂掉表示不高兴。《乌鸦与狐狸》第一次画不像,给人看范画再抄一遍才像样,奶酪出现三次:嘴里、落下、狐狸嘴里。跟人对画时,人把车画在纸上方,它理解成飞车,给车和火柴人各加一朵乱线云。
同一任务从 Gemini-1.5-flash 到 Gemini-2.5-pro,早期抽象到认不出主体,却口齿清楚地宣布自己在画什么;2.5-pro 才清楚。对照 Gemini-2.0-flash-exp 和 ChatGPT-4o 的文生图:寓言很难压进一张图,风格也更传统。外部落地是一本 24 幅画的画册,以及 2026 年艺术中心个展里的两件参与式装置。
对做具身智能和创意工具的人,这篇把「LLM 当大脑、机械臂当手」落到一个能办展的闭环:语音进、相机看、工具调用出、物理线质当风格。ICL 消融是工程上能带走的那一刀:只给视觉示范过不了「看见→动作」的翻译缝,过程性画法可以。
别把它当通用绘画模型。纸面只有 170×130 mm,分数来自七个人的专家共识,没有 FID 或 CLIP score。它证明的是一种合作方式,不是新的生成架构。
作者自己的专家板把意图/能动性打到最低。评委并不买「机器有意识」的账。狐狸和乌鸦要靠现场示范才画得像,词表外对象的泛化并不稳。只给图不加方法时,视觉示例反而干扰模型已有的内部知识。主文几乎没有定量指标:没有成功率,没有和 SketchAgent 或 Bossema 系统的对照数字,模型代际比较也是同一任务六张图的目测。附录还写过空间指令会偏,绕已有图形画圆第一次没包住,十字中心定位能偏 1–2 cm,迷宫走不出去。
七位评委全认识第一作者的旧作。熟悉度有助于聚焦新系统,也让「原创性 5.86」很难跟陌生人评审比。TTS 口音和转关节轮次是精心设计的人设,换一个没见过这套装置的用户,陪伴感会不会还在,论文没测。无障碍方向只在结论里提了一句。