EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy
Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li
cs.RO
2026-08-31
不微调后端,把VLA与世界模型当技能编排。LIBERO-Plus达93.9%对Cosmos 82.2%,真机叠杯94%。
单条 VLA 或世界模型把看、想、动、验捆成一次前向,中途一步错,后面的假设一起塌。Harness 把高层智能体叠在策略上,但又常把感知、监控、验证的原始痕迹整段塞回规划器。上下文被低层证据撑满,下一步该调谁、该不该重来,判断反而变钝。
真问题是系统组织:专用能力各干各的,规划器每一步只看到做决定够用的信息。清华领衔,南理工、西交、西电、哈工大、北大、南洋理工参与的 EMERGE-Policy,把这套组织写成图结构智能体框架。
主智能体用闭源 Codex(文中写作 codex-5.6-sol)守一块主动上下文:指令、当前子目标、计划状态、恢复栈顶、压缩记忆、最近结构化证据、技能的一行签名。指令被拆成带完成判据的子目标,每个是三元组「对象、状态变化、完成条件」,记在 PLAN.md。
证据处理不进主窗口。感知、验证、监控、记忆整合各有独立上下文,异步跑完只回结构化结果。技能按功能分三类,跟模型族脱钩:
失败不立刻全局重规划。验证子智能体回报失败类型与证据,主智能体写一段文字诊断(思路来自 Reflexion),把局部恢复目标推进 Branch Stack;栈顶先做,做成了弹栈回到原计划,连续失败约两次才改高层计划。上下文碰到 token 上限时,记忆整合智能体把时间线摘要追加进 HISTORY.md,把可修订事实并进 MEMORY.md。四类外部状态每个 episode 清零,评测不做跨回合在线适应。
实验里后端用官方 checkpoint,不额外微调。LIBERO 系列上 Operational 用 π0.5 或 Cosmos-Policy-LIBERO-Predict2-2B;Cosmos 同时充当 Imagination,每步抽 5 条、视野 16 步的动作块,轻量视觉语言模型打分后贪心选,单步大约多 1.2 秒。规划侧另加 5 路固定相机,不喂给底层 VLA 或世界模型。感知子智能体接 SAM3 分割和 VGGT 几何先验。每个基准一份 AGENTS.md,底层规划器和动作原语集合保持不变。
标准 LIBERO 已经贴天花板,编排增量主要落在长程套件。
| 方法 | Goal | Spatial | Object | Long | 平均 |
| π0.5 | 98.0 | 98.8 | 98.2 | 92.4 | 96.8 |
| EMERGE(π0.5,无世界模型) | 98.2 | 99.2 | 100 | 97.8 | 98.8 |
| Cosmos Policy | 98.2 | 98.1 | 100 | 97.6 | 98.5 |
| EMERGE(含世界模型) | 99.2 | 99.0 | 100 | 98.6 | 99.2 |
拉开差距的是扰动和隐式指令。LIBERO-Plus 七类扰动上,带世界模型的 EMERGE 平均 93.9%,对 Cosmos 的 82.2%,多 11.7 点;无世界模型版 88.3%,对 π0.5 的 85.7%,多 2.6 点,但背景、传感器、光照三项相对 π0.5 分别掉 4.9、5.5、4.5 点。RoboHarness 公开数字是 93.2%。论文写明:相机和步数预算跟公开基线并不完全对齐。
LIBERO-Pro 隐式指令更刺眼。相对 π0.5,Spat-S 从 20.0% 到 95.7%,Obj-S 从 17.0% 到 100%,L10-S 从 8.0% 到 59.1%,显式/隐式合计 72.2/77.8,对 52.8/20.8。
RoboDojo 双臂上平均分 20.46、成功率 13.54%,跟 GalaxeaVLA G0.5 的 20.23/14.88% 几乎打平。记忆维 25.00/22.51%,对 G0.5 的 8.61/7.33% 和 π0.5 的 5.78/4.56%。精度和长程两项低于 G0.5。
真机做三层纸杯金字塔,底层 3 只、中层 2 只、顶层 1 只。标准条件 100 次,成功率 94%。四类干扰各 30 次:改相机视角与数量掉到 85%,中途拆掉已搭结构后重规划 86%,杯径变 5% 到 15% 仍有 92%,场景颜色 93% 到 94%。注入任务先验后,规划步数少 24.7%、墙钟时间少 16.3%,成功率 96.7% 对无先验的 95.2%。
LIBERO-Plus 消融:去掉 Evaluation 掉到 85.6%,少 8.3 点;去掉世界模型 88.3%,少 5.6 点;去掉验证和监控子智能体 91.2%,少 2.7 点。模块连着剥,93.9% 到 88.3% 到 84.4% 到 82.2%,最后一档回到 Cosmos 本体。Imagination 关掉、只对当前观测打分,扰动平均 85.1%。
对已经在用 π0.5 或 Cosmos 的人,这是一层不改权重的编排壳:验证、局部恢复、世界模型选动作,都能加在现成 checkpoint 上。扰动和隐式指令上的跳变说明,瓶颈经常在看错对象、不知道做完没做完、不会局部重来,不在再训一个百分点的策略。
这是渐进的系统工作,不是新的动作生成器。标准 LIBERO 的 0.7 到 2.0 点,论文自己说要跟试验次数和不确定性一起看。能落地的部分是接口:技能按功能注册,子智能体只回结构化证据,失败进栈、不进全局重规划。代价是闭源规划器、额外相机、加长步数预算,以及每步约 1.2 秒的想象选动作开销。
论文自己划了几条线。标准 LIBERO 近天花板,数字差不能当突破。相对端到端策略的对照,隔离不了异步子智能体的贡献,需要在同一套相机、工具、提示、交互预算下跟单智能体 harness 比;这篇还没给出这份对照。真机统计强度取决于重复次数、干预规则、失败分类有没有完整报,结论段把这点写进了未来工作。
评测协议本身有偏。规划侧多 5 路相机、放宽每回合步数,公开表上的基线未必享受同一预算。高层规划器是闭源 Codex,复现和迁移都绑在这个选择上。记忆只在 episode 内有效。任务相关的 AGENTS.md 和人工先验会改轨迹形态,效率数字有一部分来自提示工程。RoboDojo 上记忆和开放维明显变好,精度和长程不如榜首,写不成全面超越。SAM3 在遮挡、光照、含糊外观上会漏检,要靠 VGGT 补。