LightOnOCR-3 揭示:单一版面模型无法覆盖全部文档类型
IgorCarron · x · 2026-10-09
LightOn 团队继续分享 LightOnOCR-3 训练经验:他们很快发现没有任何单一版面模型能在所有目标文档类型上可靠工作——擅长学术论文的模型可能搞不定手写体,另一些会漏检区域或错误切分段落。因此团队转向组合多个互补来源来构建训练数据。这与上一条共用 LightOnOCR 2 参考文本的方案相呼应。
「研究」频道最新
- URM 小模型靠循环深度反超大模型,UT 架构会翻身吗 — moschles · 2026-10-09
- AutoScientist 用双智能体清单自动审查每个训练样本 — sarahookr · 2026-10-09
- NeurIPS 医疗评测论文入选 Oral:检索式事实核查的系统性失败图谱 — mdredze · 2026-10-09
- 同团队再强调:更大模型与更强推理都修不好医疗事实核查 — mdredze · 2026-10-09
- DEX 最佳摘要:大模型能揪出医生大量诊断错误,但差距仍大 — mdredze · 2026-10-09
- HCOMP 最佳论文:ROUGE 与 LLM 评审都测不出摘要读者满意度 — mdredze · 2026-10-09