FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava Das
cs.AI, cs.CV, cs.LG
2026-08-02
FactorJEPA 把 JEPA 单体未来预测拆成布局、可见度门控智能体、稀疏交互三路,在 1000 小时印度街头数据集上四个诊断指标稳定隔开次优方法。
世界模型(world model)的任务是从已有画面预测接下来会发生什么。JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)是其中一条主线:它在一个抽象表征空间里预测未来的 embedding,而非逐像素重建,从而避开重建噪点的浪费。这条路在车道清晰、密度较低的欧美驾驶数据上已经跑通。
但 JEPA 的评测几乎没碰过另一种场景:印度及南亚这类城市街道。车道线在这里形同虚设,行人、汽车、摩托车、三轮车、推车甚至牲畜挤在一起,遮挡严重,行进靠的是即时的人际博弈。作者把这类场景叫做 DENSEWORLD,并指出一个被忽视的失败模式。在稠密场景里,布局、人群密度、可见度、交互压力高度相关,单体预测器(把未来压进一个 latent)会走捷径:拿人群纹理冒充交互、拿路面几何冒充运动,而不真正恢复场景结构。为了研究这个问题,他们发布了 DENSEWORLD 数据集,约 1000 小时视频、22 个印度一二线城市、行车与步行与航拍三种视角,已做人脸和车牌模糊。
FactorJEPA 的核心改动是把单体预测器拆成三个显式通道:
三个通道的预测在块结构里重组,未来表征 = 布局项 + 智能体项 + 交互项。一个分离损失(separation loss)惩罚通道之间的线性与非线性泄漏,防止模型把三路又混回去重新走捷径。可见度门用二值交叉熵单独校准。
整个改动被作者称为「预测器外科手术」(predictor surgery):只换掉单体预测器,在线编码器、动量目标编码器、mask 策略全部沿用预训练的 V-JEPA。训练按 Layout → Agent → Interaction 的分阶段课程进行,逐块解冻编码器顶层。监督目标由冻结的 DINOv2 流水线从视频里自动抽出区域、可见度、相对运动,再转成三类目标,而非人工标注。
论文设计了四个诊断指标:Future-frame L1(未来表征精度,越低越好)、Causal L1(对干预的敏感性,越低越好)、Mask-ratio slope(逐步遮挡画面后误差上升的斜率,越低越鲁棒)、Motion cosine(线性可读出的运动信息,越高越好)。
先看一个最直白的绝对结果。在运动探针上,10 个主流冻结编码器(含参数量到 20 亿的 V-JEPA 2.1)的 Action top-1 全部挤在 37.5% 到 44.4% 之间,而多数类基线只有 19.5%。最强的冻结模型在这种场景里也只是明显高于多数类、远没到可用;微调后才到 50.3% 到 53.2%。冻结态的运动余弦低至 0.004 到 0.019,接近零。
再看 FactorJEPA 与次优方法的可分离性。这里的倍数是「配对差值 95% 置信区间宽度」的倍数,衡量排名有多稳,不是原始指标涨了多少倍(作者特别强调这一点):
| 设置 | Future-frame L1 | Causal L1 | Mask-ratio slope | Motion cosine |
| 分层 1 万(2B) | 6.3× | 2.3× | 0.9× | 权衡落后 |
| 分层 1 万(1B) | 4.8× | 2.7× | 1.9× | 权衡落后 |
| 全量 11.5 万(1B) | 33.2× | 13.9× | 43.3× | 20.0× |
在分层 1 万片段协议下,2B 与 1B 两个骨干网都把 Future-frame L1 和 Causal L1 拉开,Mask-ratio slope 只在 1B 上拉开。换到 1B 全量 11.5 万片段训练,四个指标全部显著隔开,最高到 43.3 倍。方法排名在 2B 与 1B 之间高度一致,Spearman 相关 ρ 从 0.895 到 0.978,Causal L1 最高达 0.979。
代价是 Motion cosine 这一档微调整体领先 FactorJEPA。结构化预测换来了对未来表征和干预敏感性的把握,却部分牺牲了对线性运动信号的编码,全量训练才把这个短板补回来。
价值有两块。方法上,这篇把「世界结构」做成一等公民的预测目标,不塞进一个 latent 让模型自己组织,给稠密遮挡场景的可解释、可干预预测提供了一条可复现的路。数据上,DENSEWORLD 补上了 JEPA 评测的地理盲区。对在南亚、东南亚、非洲、拉美这类非结构化交通里做自动驾驶或机器人感知的人,这是一个现成的基线和诊断套件,数据和权重都已开源。
作者自己列得相当诚实。交互仍是最大短板:只建模稀疏成对耦合,群组运动、多智能体谈判、时序持续的交互事件都没覆盖,而街头博弈恰恰是这些。因子语义只在通道层面对齐,靠 DINOv2 自动生成目标,不等于坐标级可识别,换一组老师模型可能得到不同的、但同样能预测的划分。评测针对预测结构而非完整因果,Causal L1 测的是干预敏感性,不是因果识别或反事实推理。地理覆盖是 22 个印度城市的「一个大规模实例」,不等于整个全球南方。全量训练只跑了 1B,2B 只在分层 1 万子集上评;latent 到 RGB 的解码器还可能模糊、丢小目标、把不确定性塌缩成单一未来。
额外存疑一点:标题里的「43.3 倍」是统计分离倍数,不是绝对提升,大数字容易让人误读成效果提升 43 倍。