人大提出 LoopVL:循环 Transformer 视觉语言模型胜过更大非循环模型
RUC · hf · 2026-10-01
RUC 团队提出 LoopVL,探索 Loop Transformer 能否有效扩展到视觉语言模型。
核心设计: 结合 Module-Loop 与 Model-Loop 两种计算方式,通过共享模块迭代更新统一的视觉-语言状态,并从零开始完成语言预训练、多模态训练与后训练三阶段训练。
结果:
- 在多模态理解与视觉推理基准上超越一系列同等规模甚至更大的非循环模型
- 观察到「视觉顿悟时刻」(Visual Aha Moments):跨循环中视觉注意力发生显著跳变
这项工作为循环式视觉语言建模提供了实践证据,展示了共享参数如何支持在持续演化的视觉-语言状态上进行更深层的多模态计算。
「多模态」频道最新
- Supertonic 原仓库已归档停止维护,代码模型转入 archive 组织仅供取用 — JafarNajafov · 2026-10-01
- 本地秒出录音棚级配音:9900万参数开源TTS跑赢ElevenLabs — JafarNajafov · 2026-10-01
- 389 个 Opus 5.5 病毒视频及原版 prompt 被集中收录,可对照复刻 — CodeByPoonam · 2026-10-01
- 四款图像模型横评:Boogu Turbo 快,Krea2 知识广,各有硬伤 — COMPLOGICGADH · 2026-10-01
- 九类对口型翻车场景:有人正在自建 lip sync 失败案例基准 — NewPhoneWhotiz · 2026-10-01
- Diffusers 张量并行加载升级:Flux.2-Dev 加载提速 2.4 倍 — RisingSayak · 2026-10-01