VisionHOPE:首个自我改造学习系统的通用视觉骨干网络
CASIA · hf · 2026-09-30
中科院自动化所(CASIA)发布论文 VisionHOPE,首次把视觉骨干网络构建为「自我改造学习系统」:
- 梳理了从 CNN 到 ViT、SSM 再到测试时训练(TTT)层的演进:视觉计算越来越依赖输入自适应,但适应规则仍由训练好的骨干预先规定
- 基于 Nested Learning 的自指构造,模型「记什么」与「怎么学」在单张图像内部共同演化,通过五个耦合记忆存储内容、生成 K/V 并控制学习率与保留
- 直接应用自指更新会不稳定,作者推导出稳定性匹配的步长控制(自指注入软上限 + 保留记忆转移的谱钳制),并证明记忆动力学在每次扫描中非扩张
- 将 NL 的 chunk 公式适配到 2D 特征图,沿行列做四方向扫描对齐
- 在 ImageNet-1K、COCO、ADE20K 上取得有竞争力的结果,代码已开源
「研究」频道最新
- UIST 2026 论文 Tempo:让计算机使用智能体理解你的长期目标 — kenziyuliu · 2026-09-30
- UMAP 作者预告新版本:为超大规模数据优化扩展性 — leland_mcinnes · 2026-09-30
- Chollet 谈 AGI 通用性测试:能否即时通过 ARC-AGI-(n+1) — fchollet · 2026-09-30
- 实测 Jev 作重排器:性价比不错的默认选择,但非万能 — amaarora · 2026-09-30
- Reality Check:4 个开源模型 14400 次真机 rollout 测机器人策略 — YuXiang_IRVL · 2026-09-30
- 分析 Agent 总说错因?团队拆解记忆系统四条关键设计决策 — Financial-Shirt2304 · 2026-09-30