把Gemini接到四轴画笔臂上,七位专家给审美身份打6.0

An Embodied Companion for Visual Storytelling

Patrick Tresset, Markus Wulfmeier

cs.HC, cs.AI, cs.GR, cs.RO

2026-01-18

四轴画笔机器人接Gemini工具调用,与人对纸讲故事。七位艺术专家给审美身份打6.0/7,机器意图感最低4.71。

这篇在解决什么

Patrick Tresset 做了十五年会自己落笔的绘画机器人。最初的动机是把自己从执行里拿开,看机器单独能画出什么。画面整齐,却缺人的经历带出来的意思。后来一位策展人点破缺口:艺术家本人不在场。

EACVA 项目里,他和 Google DeepMind 的 Markus Wulfmeier 把方向拧过来:把人的手重新放进执行过程。Companion 不是再做一个自动画师,也不是文生图再拿机械臂描一遍。它是一台会说话、会看纸、会用工具调用下笔的 Gemini 代理,跟人对着一张 170×130 mm 的纸轮流讲故事。

方法

硬件是自制四轴平面臂(肩、肘、腕、抬笔),Dynamixel 舵机。精度故意不高。间隙、柔顺、机架弹性被当成风格来源,速度一变,线质就变。视觉是 Logitech C920 加云台。交互几乎全靠说话:把肩关节转大约 10 度开始录音,静音自动停;人在纸上加了线,就转相机拍照。底层用比 ROS 更轻的 YARP。

智能层是 Python 代理接 Gemini API。系统指令把人格钉成「爱讲故事的绘画机器人」:人用火柴人,有机物用样条,允许轻微不对称,加粗就偏一点重描。模拟画布 1200×900 像素,新元素要留 40 像素空隙,免得叠在一起。

下笔不走 SVG。他们试过让模型出矢量路径,风格太可预期。改成一组过程性工具:涂鸦填充、排线、圆、线段、Hershey 字体、三次样条,还有沿中心样条抖动的乱线。模型 function calling,参数进绘图系统再变成机械臂路径。

风格靠 In-Context Learning 灌进去。24 张手绘草稿,每张配一段 Gemini 自己写的「怎么大概画」。附录消融很清楚:只给图、不给画法,输出碎、怪,模型看见了却不会翻译成工具序列;图加画法一起给,它会把「底下排线当地面」「有机体用曲线」这类动作语法推到没见过的对象上。论文把这叫 procedural style transfer。方法写得太细,机器人反而变僵。

语音合成用 gTTS 或 eSpeak,语言参数设成法语或西班牙语去读英文,弄出一口非母语口音,拉开和客服式助手的距离。

结果

评估走艺术圈的 Consensual Assessment Technique。七位专家(五位职业策展人、一位藏家、一位用机器人的艺术家)看作品集和交互录像,1–7 打分。他们都熟悉 Tresset 以前的绘画机器人,所以打的是 Companion 这套新系统,不是「机器人能画画」这件事本身。

维度均分备注
Aesthetic Identity6.0(SD 0.81)最高,组内一致性 rwg=0.67
Originality5.86
Global Quality5.71专家认为够办展
Conscious Presence/Intent4.71(SD 1.11)最低,分歧也最大

专家把风格比成史前岩刻、Paul Klee、Basquiat。一位策展人说作者身份「感觉是共享的,不是简单委派」。

角色实验是定性的。当「艺术总监」时,机器人会听话加衣服和帽子,也会拒绝用虚线箭头表示时间;有一次不把人物换位去接羽毛,直接画了一条特别长的胳膊。当插画师时,《龟兔赛跑》词表里没有龟和兔,仍画得出:乌龟重复六次、兔子三次、右边竖线是终点、最后一只兔子被涂掉表示不高兴。《乌鸦与狐狸》第一次画不像,给人看范画再抄一遍才像样,奶酪出现三次:嘴里、落下、狐狸嘴里。跟人对画时,人把车画在纸上方,它理解成飞车,给车和火柴人各加一朵乱线云。

同一任务从 Gemini-1.5-flash 到 Gemini-2.5-pro,早期抽象到认不出主体,却口齿清楚地宣布自己在画什么;2.5-pro 才清楚。对照 Gemini-2.0-flash-exp 和 ChatGPT-4o 的文生图:寓言很难压进一张图,风格也更传统。外部落地是一本 24 幅画的画册,以及 2026 年艺术中心个展里的两件参与式装置。

为什么重要

对做具身智能和创意工具的人,这篇把「LLM 当大脑、机械臂当手」落到一个能办展的闭环:语音进、相机看、工具调用出、物理线质当风格。ICL 消融是工程上能带走的那一刀:只给视觉示范过不了「看见→动作」的翻译缝,过程性画法可以。

别把它当通用绘画模型。纸面只有 170×130 mm,分数来自七个人的专家共识,没有 FID 或 CLIP score。它证明的是一种合作方式,不是新的生成架构。

局限与存疑

作者自己的专家板把意图/能动性打到最低。评委并不买「机器有意识」的账。狐狸和乌鸦要靠现场示范才画得像,词表外对象的泛化并不稳。只给图不加方法时,视觉示例反而干扰模型已有的内部知识。主文几乎没有定量指标:没有成功率,没有和 SketchAgent 或 Bossema 系统的对照数字,模型代际比较也是同一任务六张图的目测。附录还写过空间指令会偏,绕已有图形画圆第一次没包住,十字中心定位能偏 1–2 cm,迷宫走不出去。

七位评委全认识第一作者的旧作。熟悉度有助于聚焦新系统,也让「原创性 5.86」很难跟陌生人评审比。TTS 口音和转关节轮次是精心设计的人设,换一个没见过这套装置的用户,陪伴感会不会还在,论文没测。无障碍方向只在结论里提了一句。

术语

原文与代码

社区讨论

相关论文

全部论文解读