30亿参数OCR模型跑在浏览器:纯Rust编译,数据零上传
doodlestein · x · 2026-08-12
开发者推出了 frankenocr,一个完全在浏览器标签页内本地运行的 30 亿参数 OCR 项目。
- 核心特性:将百度的 Unlimited-OCR 等视觉语言模型手写移植为内存安全的 Rust 代码,编译为 WebAssembly,纯 CPU 推理。无需 PyTorch、Python 或 GPU。
- 隐私安全:文档处理完全在客户端完成,0 字节上传,由浏览器 CSP 强制保证数据不离开本地。
- 模型矩阵:包含处理文档转 Markdown 的主模型(2.8 GB int4)、乐谱识别(58 MB)、公式表格(776 MB)和图像描述(1.0 GB)。
- 性能权衡:桌面端处理单页文档约需 80-250 秒,主打极致隐私而非极速。
所属事件:FrankenOCR实现浏览器端本地高精度文字识别(2 条相关)→
「编程与Agent」频道最新
- JarvisHub:开源画布原生多模态创意智能体框架 — moonsandhues · 2026-08-12
- 跳过阿里云配置:通过聚合 API 调用 Wan 3.0 实战指南 — Practical_Low29 · 2026-08-12
- 实战分享:优化 Gemma 智能体延迟的踩坑经验 — leslysandra · 2026-08-12
- Mendel Gödel Machine:基于比较进化的递归自改进编码智能体 — LMU · 2026-08-12
- 智能体系统中的协同进化:迈向超越人类设计的自主进化 — Qing Zong · 2026-08-12
- SkillZip:通过发现可重用结构实现智能体技能的无评估压缩 — Xiaofan Bai · 2026-08-12