人大提出 LoopVL:循环 Transformer 视觉语言模型胜过更大非循环模型

RUC · hf · 2026-10-01

RUC 团队提出 LoopVL,探索 Loop Transformer 能否有效扩展到视觉语言模型。

核心设计: 结合 Module-Loop 与 Model-Loop 两种计算方式,通过共享模块迭代更新统一的视觉-语言状态,并从零开始完成语言预训练、多模态训练与后训练三阶段训练。

结果:

这项工作为循环式视觉语言建模提供了实践证据,展示了共享参数如何支持在持续演化的视觉-语言状态上进行更深层的多模态计算。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →