中科大等提出视觉预训练新范式:仅用 1/4 Token 超越纯文本
量子位 · wechat · 2026-07-31
中科大与上海人工智能实验室联合提出了一种全新的视觉预训练范式(VP)。研究发现,在真实的科学语料中,图片承载了文字无法无损翻译的视觉逻辑。
- 核心突破:通过在连续视觉表征空间中“预测下一个视觉单元”,模型能直接从图文交织的文档中学习。相比传统的文本预训练,VP 仅需约四分之一的 Token 便能取得更好的效果。
- 能力提升:VP 不仅在 MMLU-Pro 等纯文本推理基准上全面优于纯文本预训练,还展现了清晰的 Scaling law 趋势。同时,无需显式图文配对监督,就能有效促进跨模态对齐。
- 落地应用:该技术已应用于 Intern-S2-Preview 系列多模态大模型的预训练,且基于国产昇腾算力平台完成,显著提升了模型的科学推理与多模态理解能力。
「研究」频道最新
- Deep20Bench用“20个问题”测试大模型,Opus 5与Kimi K3领跑逻辑推理 — wauwau0977 · 2026-07-31
- GitHub 千星新书《实践中的数据结构》:从硬件视角重塑系统开发 — tom_doerr · 2026-07-31
- 论文揭示 Deep Research 漏洞:误导信息致其得出虚假结论 — Pengyu Zhu · 2026-07-31
- 研究揭示简单图像变换即可绕过主流AI内容审核系统 — chaumian · 2026-07-31
- Pangram-4 技术报告:用 Repeat2 等技巧训练 SOTA AI 文本检测器 — RexDouglass · 2026-07-31
- Kimi K3 架构解析:用「主动遗忘」打造 2.8 万亿参数开源模型 — AccBalanced · 2026-07-31