复旦 ScriptMoE:单一模型识别 229 种语言,准确率超 VLM
Fudan-University · hf · 2026-09-23
复旦大学发布多语言场景文字识别(STR)工作,包含两项核心产出:
- TextMuSS-10M 数据集:覆盖 10 种文字系统、229 种语言的大规模合成场景文本数据,弥补真实数据稀缺。
- ScriptMoE 架构:共享单一视觉编码器,用文字感知的稀疏 MoE 解码器替代稠密解码器——图像级路由器将每张图分派给 top-2 个文字对齐专家,另设共享专家吸收跨文字知识。
实验结果:
- 自建 TextMuSS-Bench(10 种文字、10,899 张图)上准确率 82.06%,超最强 STR 基线 1.31 个百分点。
- 将 PP-OCRv5 中的识别器替换为 ScriptMoE 后,CC-OCR 端到端多语言任务 F1 从 65.71% 提升至 80.89%,以远小的参数量略胜最强 VLM(80.73%)。
定位是比逐语言专家更简单、比大 VLM 更轻且更准的多语言识别方案。
「研究」频道最新
- TensorSharp 直读 label logits,结构化决策比 LocalJev 快 3.3 倍 — fuzhongkai · 2026-09-23
- Naproche:用受控自然语言写数学证明的证明助手 — zetalyrae · 2026-09-23
- 南京大学用 AI 从零设计超强蛋白,强度超天然 4 倍耐 150°C — MikePFrank · 2026-09-23
- 开源 GUI 智能体跨设备实测:复合任务最佳成功率仅 8% — maier_ak · 2026-09-23
- JarvisGUI 基准:跨 Android/Windows/Ubuntu 考验 GUI 智能体 — maier_ak · 2026-09-23
- 新基准 Cross-DURIAN:专测多设备 GUI 智能体跨屏协作能力 — maier_ak · 2026-09-23