FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos
Maya Moriya, Sigal Raab, Yael Vinker, Tali Dekel
SIGGRAPH ASIA 2026
cs.CV, cs.AI, cs.GR
2026-09-01
魏茨曼与MIT用VLM加折纸模拟器,从演示视频逐步还原可执行折叠程序。在27条Pureland序列上,完整agent编译率96%、序列全部跑完;只让VLM直接预测折痕图,编译率只有8%。
折纸的人类知识几乎全靠演示:步骤图、教学视频。计算折纸要的是结构化对象,通常是一张摊平后标好山折、谷折的折痕图,或者一段可执行动作。两边对不上。已有工作多半假设几何已经写好,再去做可折叠性分析、仿真、从折痕图反推步骤。从真实演示视频还原「每一步折了什么」,几乎没人做。
难处很具体。手会挡住纸;层叠越来越多,内部构型从画面上看不见;一次折叠会牵动远处的层和新折痕。逐步预测还会把早期错误放大到后面。论文把范围收在 Pureland:每一步都是沿一条直线的平面折叠,动作用 fold / unfold / rotate / flip 就能写完,中间态保证是平折的多边形。
输入不是整段视频自动切帧,而是人工抽出的关键帧。状态用扩展过的 FOLD 图:顶点、边、面,再加上正反面朝向和层序。层按「平面」管,同一平面里由平坦边连起来的面一起动,折完再重算层。
动作空间五个可组合原语:addvertex 在边上按比例插点,fold 沿边把一侧翻过来,unfold 把先前的折复原成痕迹,rotate 平面旋转,flip 沿轴翻转。两帧之间往往要组合几步,比如先插点再折,或先转身再折。
执行层是零样本 VLM agent(主实验用 Gemini 3.1 Pro Preview)加确定性控制器。工具分四类:模拟器里的动作、看帧/看动作条/渲染当前状态、存取 checkpoint、以及独立的视觉 critic。critic 看四宫格:源/目标照片对上源/目标渲染,给出 Match / Mismatch / Extreme Divergence。提议和核对拆开,减少自己给自己圆场。
走不通就回滚。同一转移试三次还得不到 Match,就拉总览找最早跑偏的 checkpoint,从更早的确信状态重来。每帧最多 5 次尝试,全程最多 300 次工具调用。预算用尽则另派一个轻量选择器,在探索过的状态里挑最像目标的,并锁死已经提交的前缀。平均每条序列约 140 次查询、400 万输入 token、6.8 万输出 token,成本 8.9 美元。
新基准 PurelandFold:27 条自己拍的教学序列,指令来自 OrigamiWay 的 Easy Origami,关键帧标注了动作和几何。平均 12 帧,最短 5、最长 21。没有直接可搬的前人方法,对照是三级消融。
| 方法 | 完成序列 | 编译率CV | TSS | GS | CS | FFS | CPD↓ |
| VLM-CP 直接预测折痕图 | 96% | 8% | 0.76 | 0.20 | 0.20 | 0.30 | 363 |
| VLM-S 预测动作 | 85% | 96% | 0.79 | 0.51 | 0.53 | 0.21 | 268 |
| VLM-S-C 动作+非agent式critic | 85% | 96% | 0.80 | 0.48 | 0.49 | 0.19 | 216 |
| FoldingAgent | 100% | 96% | 0.90 | 0.58 | 0.77 | 0.39 | 189 |
换表示就把绝大多数输出从「编译不过」变成合法几何。完整 agent 的增益主要在拓扑、约束和终态层序,因为能发现早期错折并回滚。用户研究 600 次判断、10 条三种方法都跑完的序列:渲染更接近关键帧的票,FoldingAgent 对 VLM-S 为 84%,对 VLM-S-C 为 80%。
五条序列的骨干对照里,GPT-5.5、Claude Opus 4.8、Gemini 3.1 上,FoldingAgent 都把完成数和相似度拉起来;纯 VLM-CP 在 GPT 和 Claude 上 0/5 完成。critic 本身约 88% 判对,错批会传下去,回滚协议就是为这个准备的。
这是把「看人折纸」变成「可编辑、可仿真、可交给机器人」的程序。对图形学是反问题;对机器人是从海量教学视频里回收操作程序的一条路径。方法本身是标准的 ReAct 加领域模拟器,价值在动作空间和回滚协议,不在新训一个折纸模型。代价也不便宜:一条序列近 9 美元、上百万 token,关键帧还靠人手切。
性能绑在底层 VLM 的推理上。遮挡严重、层叠看不清的折,仍然容易看错。同时发生的复合动作,比如边转边翻,超出当前按序原语。范围只覆盖 Pureland,更复杂的折要扩动作空间。关键帧是人工抽的,评测视频是自己拍的高对比布里斯托纸,不是网上的嘈杂教学。没有在未切帧的长视频上报告端到端数字。8.9 美元一条,离批量回收网上折纸还远。