百度 Unlimited OCR 用 R-SWA 和 30 亿参数连续解析数十页文档
vista8 · x · 2026-07-22
这条帖子在讲百度开源的 Unlimited OCR,并称 Yann LeCun 也关注到了这个项目。
帖子重点介绍了它提出的 Reference Sliding Window Attention(R-SWA) 机制:
- 不再走传统的“逐页解析 + 结果拼接”流程
- 借鉴人类阅读和抄长文档的方式
- 在解码阶段把 KV Cache 控制在恒定规模
- 只用 30 亿参数,就能连续解析数十页文档
帖子还给出了一组传播数据:
- 开源第二天就冲上 GitHub Trending 和 Hugging Face 下载榜 双第一
- GitHub Star 已超过 1.65 万
- Hugging Face 下载量超过 224 万
- 目前再次回到 Trending,且排在第二
发帖人把它看作是大模型训练数据清洗的“基建型项目”。
所属事件:百度开源Unlimited-OCR长文档解析模型(3 条相关)→
「模型」频道最新
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11
- antirez 谈 Anthropic 禁止未成年人使用 Claude — antirez · 2026-09-11