olmOCR-bench 已饱和:Datalab 推出可审计的 OmniParseBench
VikParuchuri · x · 2026-10-10
Datalab 发布 OmniParseBench:来自 2343 份文档 2937 页、92 种语言的 16288 项通过/失败测试,数据与打分代码全部开源。
发布动机:
- olmOCR-bench 已饱和:该团队使用一年多后认为剩余差距主要来自输出格式对齐而非真实阅读能力;测试按页面来源归桶,混合内容(如手写表格、表格内公式)的弱点被平均掉。
- ParseBench 的问题:五种能力各自使用不同指标,单位不统一,无法相互比较或合并。
设计原则:
- clear:每个测试都是关于单页的是/否问题,得分为通过率,并附测试与文档数量,薄切片一目了然。
- auditable:每个测试记录答案依据,打分器为开源代码,无模型裁判。
- explorable:测试按检查内容打标签,任何切片(手写表格、泰文等)都可单独查看得分。
所属事件:Datalab 发布开源 OCR 基准 OmniParseBench(5 条相关)→
「模型」频道最新
- 马斯克演示 Grok 可为任意主题生成模拟场景 — elonmusk · 2026-10-10
- Burkov断言:仅靠模型本身永远无法解决幻觉问题 — burkov · 2026-10-10
- 4GB 显存 10 分钟微调:Qwen3.5 0.8B 决策模型准确率 37% 升至 65% — danielhanchen · 2026-10-10
- repligate:被列入模型罪状集恰说明模型已足够守规矩 — repligate · 2026-10-10
- 博主实测称 Opus 5.5 fast 模式约 285 TPS,仅耗 2 倍用量 — imjustnewatai · 2026-10-10
- 重度用户实测 Opus 5.5 用量:所谓无限额度热炒疑似 GPT 用户外流错觉 — ryunuck · 2026-10-10