图世界模型把 Qwen3-8B 长程家务规划成功率从 41.2% 拉到 91.8%

GAVEL: Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning

Ruiyang Wang, Hao-Lun Hsu, Swarajh Mehta, Jiwoo Kim, Zhihao Dou, Miroslav Pajic

cs.RO, cs.AI

2026-09-17

GAVEL 把场景图做成可模拟动作的世界模型,验证并修补 LLM 规划;Qwen3-8B 在 BEHAVIOR-1K 上单任务成功率从 41.2% 升到 91.8%,多任务从 19.9% 升到 92.6%。

这篇在解决什么

用 LLM 当家务机器人的高层规划器,计划经常跑不起来:漏掉走近再抓、对着关着的柜子伸手、洗完盘子却没关洗碗机。问题随规划变长而恶化。Qwen3-4B 单独规划 100 条 BEHAVIOR-1K 长程任务,成功率只有 21.8%;Qwen3-8B 也只有 41.2%。

常见补救是 SayPlan 那一套:图上模拟一遍,失败了把错误扔回 LLM 再生成。对小模型这既贵又不稳,Qwen3-4B 平均要 3.4 次调用才到 55.4%。另一头是 EPoG 式的图编辑规划,从当前图改到目标图,快,但「把盘子洗干净」这种要开洗碗机的语义目标,图差推不出来。

还有一层:房间布局已知、目标物体在哪未知。多数方法把信念压成「最可能的那个房间」并锁死任务顺序。这篇用来初始化位置信念的 Relational Semantic Network 在 832 条留出查询上,真房间排第一的比例只有 47%。压成点估计等于扔掉一半信息。

方法

GAVEL 把场景图当成会模拟动作后果的世界模型。图上有房间、物体、机器人,边是 near、inside、holding 这类关系,节点带着 open、cooked、washed 等状态。动作空间是九个原语:NavigateTo、Grasp、Release、PlaceOnTop、PlaceInside、Open、Close、ToggleOn、ToggleOff。每个原语带前置条件和效果,前置条件覆盖靠近、可供性、夹爪状态、容器是否打开四类。

LLM 先给每条子任务出一串动作。图把动作往前滚:前置条件不满足就停,再拿终止图对照目标和安全约束。能从图语义直接推出的修法,图自己改:抓不到就先 NavigateTo,东西在关着的容器里就先 Open,开过的柜子要关上、安全相关电器要关掉。改不了的语义错误才打回 LLM,预算最多 5 次。连续修补不一定单调变好,所以保留历史上最好的候选。

任务理解是两个挂在 Qwen3-1.7B 上的 LoRA,所有规划器和基线共用:一个抽物体和指令里已经写明的关系,一个抽目标图。8000 条合成指令训练,500 条验证。位置未知的物体交给 RSN(沿用 SEEK):冻结的 bge-small-en-v1.5 加三层 MLP,先预测房间类型,再均匀摊到同类型的房间实例,用 Platt scaling 校准。RSN 在留出场景上 AUC 0.904、Brier 0.057。

多任务时保留完整位置分布,把未定位物体的期望搜索代价和已定位物体的导航距离拼成任务代价矩阵。N≤5,所有排列穷举,只执行排第一的那条,观察更新信念后再排。排序本身每条指令 17 毫秒。若最便宜的拼接会跨任务互相干扰,就试下一个排列。

评测落在 BEHAVIOR-1K 的轻量 2D 执行器上,保留原户型、物体属性、任务谓词和导航几何。100 条单任务在 OmniGibson 上核对,成败与执行器全部一致。执行器把单次从约 17 分钟压到约 1 秒,才做得动 5500 次评测。

结果

单任务 100 条、10 个场景、参考计划平均 12.2 步:

模型方法成功率平均 LLM 调用规划时间
Qwen3-4Bllm-only21.8%1.09.2 s
Qwen3-4BSayPlan 式反馈55.4%3.427.6 s
Qwen3-4B只做图修补67.7%1.09.2 s
Qwen3-4BGAVEL88.8%1.715.0 s
Qwen3-8Bllm-only41.2%1.013.3 s
Qwen3-8BSayPlan 式反馈76.4%2.724.6 s
Qwen3-8B只做图修补76.2%1.013.5 s
Qwen3-8BGAVEL91.8%1.515.5 s

图修补单独就能让 4B 超过「把错误扔回模型」12.3 个百分点,调用从 3.4 降到 1。8B 上图修补和反馈打平,再加上语义回询才到 91.8%。

500 条多任务(Qwen3-8B,每条 2 到 5 个子任务):llm-only 19.9%,SayPlan 式 75.6%,EPoG 式 60.2%。EPoG 的失败正好对应 199 条需要电器语义状态的指令,「洗碗」从图差推不出要开洗碗机。GAVEL 92.6%。在两边都成功的集合上,路程从 SayPlan 的 83.01 m 降到 78.01 m。保留分布并在线重排,路程从 gavel-map 的 82.45 m 降到 78.01 m,约 5.4%。Oracle 用真位置是 56.17 m,中间还差一截。GAVEL 自己剩下 38 条失败:21 条物体抽取错,5 条计划不可执行,9 条目标未满足。

换更大模型替代不了这层。同一 100 条子集上,Claude Sonnet 5 单独 38.6%,GPT-5.6 Sol 单独 24.6%;Qwen3-4B 加上 GAVEL 是 75.2%。两者叠上,两个托管模型分别到 99.2% 和 99.4%,规划时间几乎不动。

为什么重要

分工清楚:LLM 负责「洗碗要开洗碗机」这种程序知识,图负责「手够不着就先走过去」这种可执行性。小模型配世界模型,比把规划全押在前沿模型上更稳。托管模型加上 GAVEL,规划时间几乎不变(GPT-5.6 Sol 仍是 16.5 秒),说明图验证本身不贵,小模型多出来的时间是在反复重规划。

残差已经挪到指令理解。还在做具身规划的人,与其再换一个更大的 planner,不如先给动作语义一层硬约束。

局限与存疑

评测停在符号动作层,图不管几何可达和碰撞。作者自己说,要把同一套验证修到物理执行,还得加运动层约束。

信念先验主要看房间类型,抓不住某一户的摆放习惯。多任务被构造成目标物体不相交,排序只影响代价不影响可行性;真实家务里子任务会抢同一个杯子。N≤5 才能穷举排列。轻量执行器虽与 OmniGibson 在 100 条上对齐,大规模 5500 次评测仍是 2D 抽象。代价模型四任务 R²=0.93、五任务 0.89,近似本身也会吃掉一部分路程。

术语

原文与代码

相关论文

全部论文解读