SegDAC:用动态对象令牌提升视觉 RL 泛化性

GlenBerseth · x · 2026-08-18

SegDAC 是一种在视觉强化学习(RL)中利用预训练分割模型的新方法。它不再基于像素,而是通过文本引导的分割生成对象掩码,提取一组可变长度的动态对象令牌。基于 Transformer 的 Actor-Critic 处理这些令牌,并使用片段位置编码保留空间信息。在 ManiSkill3 的 8 个操作任务上,SegDAC 在最难的视觉扰动设置下比之前的方法提升了 88% 的泛化性能,同时保持了最先进视觉 RL 方法的样本效率。相关代码已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →