用小型可解释模型从历史报纸提取数十亿高质量 token
institutional · hf · 2026-09-03
一个模块化 pipeline 借助小型可解释模型从历史报纸扫描件中提取结构化文本与元数据,产出包含数十亿高质量 token 的大型开放数据集,可作预训练语料。
「研究」频道最新
- SimLoss 单遍细粒度图像描述,低延迟媲美多阶段方法 — Suryaansh Jain · 2026-09-03
- Tenstorrent 联手日本机构推 JapanFold,免费提供开源制药模型推理 — DavidBennett__ · 2026-09-03
- Until 用 AI 把低温保护剂候选分子筛到 25 万个 — NirantK · 2026-09-03
- 推友激辩:CoT 提示是不是一种参数复用? — aryaman2020 · 2026-09-03
- LL(1) 语法约束解码实测:消除 Agent 语法错误,高层失误仍在 — Upstairs-Special-925 · 2026-09-03
- Nora 优化器:只取 Muon 矩阵结构精华,避开全量预处理开销 — burkov · 2026-09-03