One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA
Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov
ICRA 2027
cs.RO
2026-07-31
CS-JEPA 让每个机器人只凭本地 16 帧历史和每条边 256 字节消息,预测同一个 1105 维的未来潜目标。在拓扑和规模都变的机器群上,它比重建原始未来更省全局标注,还能从 18 台迁移到 108 台。
机器群里没有哪个成员能看见全貌,但大家又得协调行动。已有工作分几类:预测每台机器自己的轨迹、靠一个中心化的评论家给状态打分、或者对当前时刻做共识估计。这篇问的是另一个问题:能不能让每台机器,只靠自己看到的局部观测和带宽受限的消息,预测出整个群体未来的同一个集体状态?而且要省标注,下游只用很少的全局标注样本就能读出这个状态。作者称之为「去中心化的共享状态预测」。
这个目标很具体。它不是预测每台机器人各自的轨迹,不是中心化的状态评估,也不是当下时刻的共识。它是 N 个本地预测器,各自独立地产出对同一个未来量的估计。
CS-JEPA(Collective-State JEPA)。JEPA 的思路是在学到的潜空间里预测未来表征,不重建原始观测。部署时每台机器的契约很抠:只用本地 16 帧历史,每条有向边每步传一个 64 浮点(256 字节)的循环消息,只同步一轮。没有全局池化,运行时没有目标编码器,回合时钟清零,不提供未来动作。
几个要点:
训练和部署严格分开。带特权的未来目标只在预训练用。部署时丢掉目标编码器、tokenizer、解码器、锚点头,冻结本地编码器和循环预测器,只用 6、12 或 24 个全局标注的回合拟合一个小 ridge 探针。
容量控制上有个诚实的细节:CS-JEPA 的可训练参数比对照基线 Future-Recon 还少(后者多了 9607 个训练专用参数,来自原始状态解码器),两者部署时的表征参数都是 123713。可见 CS-JEPA 这场胜利是在更少训练容量下拿到的。
主结果是五颗种子的事前注册追踪(reconstruction 减 JEPA 的误差 AUC,正值利好 JEPA)。同分布上准确度 Δ+0.0046,环形拓扑 +0.0572,互 kNN +0.0534,规模外 +0.0425;一致性也都涨(环形 +0.0988)。五颗种子全为正,置信下界都大于零,每个标签预算下 CS-JEPA 的曲线都低于重建。规模外那组:训练用 10、18 台,测试 36、72、108 台,最大 6 倍,照样迁移。
密封的八颗种子动作条件实验:四步反事实价值的 MSE 从 0.0285 降到 0.0155,降 45.5%;上下文内候选分数的 Pearson 相关 +0.129(0.350 到 0.479)。八颗种子全利好,p=0.0078。
16 颗种子的全闭环:CS-JEPA 规划相对名义控制,综合效用 Δ+0.0105(p=0.0007),任务分和连通性也涨。相对 Future-Recon,首轮系数的选择更一致(+0.1447,p=0.00006),成对分歧更低。
但有一处必须说清楚:相对 Future-Recon,综合效用没有差异(Δ−0.0002,p=0.953)。CS-JEPA 赢的是决策一致性,不是实际效用。
做多机器人、机器群强化学习的人会关心:这是一个标签高效、规模不变的预测原语,固定一个极小的消息预算就能全去中心化跑。共享的未来目标把各台机器的本地证据对齐成相互兼容的预测,不需要任何显式的一致性或共识损失就能冒出来。一个冻结的表征加一个小探针,能在拓扑和 2 到 6 倍规模变化下泛化。如果建的系统里全局感知和标注很贵,这套能削掉一部分负担。
但要诚实读:CS-JEPA 赢过名义控制、赢过重建的预测准确度和决策一致性,并没有赢过重建(或专门控制器)在闭环里的实际效用。相对对照基线的胜利在一致性,不在性能。
作者承认:只在仿真里做,假设了共享的归一化坐标和无噪观测,硬件迁移、板载延迟、安全性都还没碰;预训练用了带特权的未来群体状态;五颗种子的目标隔离只覆盖了评测到的那些图族和规模;动作条件训练里,每个分支给整个群体施加同一个共享计划,而去中心化执行时各台机器可能选不同计划,训练和执行之间有缝;闭环证据支持的是「相对名义控制的效用提升」和「首轮系数一致性」,不是「相对 Future-Recon 的效用优势」,也不是相对专门控制器。
读下来的疑问:效应量都不大(效用 Δ 只有 0.0105;「降 45.5%」是从 0.0285 到 0.0155 的 MSE,真实但只在一个窄仿真区间);任务只有三个手设计的(聚集、编队、覆盖),图都是度不超过 4 的有界小世界图,到更杂乱的真实机器群任务能不能泛化没测;标题说「每台机器预测同一个未来」,一致性是冒出来了但不完美,部署时每台机器的误差仍然不同。