LightOnOCR-3 训练秘辛:用 OCR 参考文本引导逻辑分块
IgorCarron · x · 2026-10-09
LightOn 团队分享 LightOnOCR-3 训练数据处理细节:目标是产出逻辑块而非 mere 布局框。做法是以 LightOnOCR 2 的输出作为一致性参考文本,用其段落边界来指导检测到的文本行如何分组为块,从而为下游 chunking 生成连贯的逻辑块。这一细节揭示了多模态文档解析模型在训练数据构建上的工程考量。
「研究」频道最新
- URM 小模型靠循环深度反超大模型,UT 架构会翻身吗 — moschles · 2026-10-09
- AutoScientist 用双智能体清单自动审查每个训练样本 — sarahookr · 2026-10-09
- NeurIPS 医疗评测论文入选 Oral:检索式事实核查的系统性失败图谱 — mdredze · 2026-10-09
- 同团队再强调:更大模型与更强推理都修不好医疗事实核查 — mdredze · 2026-10-09
- DEX 最佳摘要:大模型能揪出医生大量诊断错误,但差距仍大 — mdredze · 2026-10-09
- HCOMP 最佳论文:ROUGE 与 LLM 评审都测不出摘要读者满意度 — mdredze · 2026-10-09