用小型可解释模型从历史报纸提取数十亿高质量 token

institutional · hf · 2026-09-03

一个模块化 pipeline 借助小型可解释模型从历史报纸扫描件中提取结构化文本与元数据,产出包含数十亿高质量 token 的大型开放数据集,可作预训练语料。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →