腾讯混元开源1B端到端OCR
腾讯混元 · wechat · 2026-07-13
腾讯混元发布 HyOCR-1.5:一个 1B 参数 的端到端 OCR 专家模型,强调训练、推理、权重全栈开源。它能覆盖 8 种以上 text-centric 任务,并通过基于 DFlash 的投机解码,在推理上达到最高 6.37× 加速;在 OmniDocBench v1.6 上拿到 94.74 分,位居端到端 OCR 第一梯队。
这篇长文重点讲了三件事:
- 更快:用轻量草稿模型 + 验证式投机解码,把长文档的自回归生成加速,同时对长输出、表格页收益更明显。
- 更强:引入 AgenticDataFlow,让智能体根据模型短板自动搜集素材、开发数据管线并迭代,补齐低资源语种、古文字、多图问答等能力。
- 更全:训练侧加入 4K 分辨率、128K 上下文和 RL 方案;评测上覆盖文档解析、古文字、图表、多语种、多图问答和幻觉抑制等场景。
文章还给出多个结果:在 Chronicles-OCR 上,1B 规模达到古文字识别 SOTA;在 ChartArena 上表现接近甚至超过部分 8B 模型;在无文字图像处理上,正确率达到 99.8%。
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11