从 PDF 存档到可训练模型:一套可复用的开源微调数据工作流
Puzzleheaded_Box2842 · reddit · 2026-09-30
很多组织和个人的领域知识都锁在 PDF、手册、报告里,但直接扔给模型或挂 RAG 并不能让知识真正进入模型,需要先把文档变成可靠的训练数据。
作者给出的流程:
- 从 PDF 提取文本、表格和文档结构;
- 去噪、修复排版、去重、把长文档切成有意义的块;
- 生成领域 QA 对或指令样本等 SFT 数据;
- 评估并过滤生成数据;
- 送入训练管线做微调;
- 新 PDF 到来时重跑数据管线,做受控的增量更新。
工具链上用 OpenDCAI/DataFlow 做数据处理(PDF 处理、清洗、生成、评估、过滤、训练格式转换),OpenDCAI/DataFlex 作为训练后端跑可配置的微调流程。作者强调「动态训练」不是上传即更新权重,而是可重复的数据→验证→转换→增量训练闭环。
「研究」频道最新
- Anthropic 开源 jacobian-lens:把内部激活线性映射为可读 token — QuixiAI · 2026-09-30
- 蒸馏视频模型频现伪影,作者长文剖析 LoRA 失配根源 — burkov · 2026-09-30
- LadderMan 入选 CoRL 2026 Spotlight:人形机器人零样本爬梯作业 — yuewang314 · 2026-09-30
- EnerTune 登 SOSP'26:推理能耗较 SOTA 降低 1.4–2.3 倍 — tianyin_xu · 2026-09-30
- NeurIPS 研讨会论文:对称正定双锥的 Hilbert 几何给出闭式距离 — FrnkNlsn · 2026-09-30
- SOSP'26 论文:面向能耗的 GPU 共享方案,重思推理服务利用率 — tianyin_xu · 2026-09-30