百度 Unlimited OCR 用 R-SWA 和 30 亿参数连续解析数十页文档
vista8 · x · 2026-07-22
这条帖子在讲百度开源的 Unlimited OCR,并称 Yann LeCun 也关注到了这个项目。
帖子重点介绍了它提出的 Reference Sliding Window Attention(R-SWA) 机制:
- 不再走传统的“逐页解析 + 结果拼接”流程
- 借鉴人类阅读和抄长文档的方式
- 在解码阶段把 KV Cache 控制在恒定规模
- 只用 30 亿参数,就能连续解析数十页文档
帖子还给出了一组传播数据:
- 开源第二天就冲上 GitHub Trending 和 Hugging Face 下载榜 双第一
- GitHub Star 已超过 1.65 万
- Hugging Face 下载量超过 224 万
- 目前再次回到 Trending,且排在第二
发帖人把它看作是大模型训练数据清洗的“基建型项目”。
所属事件:百度开源Unlimited OCR长文档解析技术引关注(2 条相关)→
「模型」频道最新
- Google高管征集 Gemini 3.6 Flash 等新模型真实反馈 — patloeber · 2026-07-22
- Gemini 3.6 Flash 快两倍便宜 18%,独立测试却没变聪明 — etherd0t · 2026-07-22
- 批评者称 OpenAI 事故被误读为“失控自主” — ambaonadventure · 2026-07-22
- Google 推出 Gemini 3.5 Flash Cyber 网络安全专用模型 — pushmeet · 2026-07-22
- 爆料称 Cerebras 升级后 GPT-5.6 Sol 速度可达 750 tok/s — haider1 · 2026-07-22
- LeCun 转发 Hugging Face:开放权重模型更利于网络防御 — ylecun · 2026-07-22