从 PDF 存档到可训练模型:一套可复用的开源微调数据工作流

Puzzleheaded_Box2842 · reddit · 2026-09-30

很多组织和个人的领域知识都锁在 PDF、手册、报告里,但直接扔给模型或挂 RAG 并不能让知识真正进入模型,需要先把文档变成可靠的训练数据。

作者给出的流程:

工具链上用 OpenDCAI/DataFlow 做数据处理(PDF 处理、清洗、生成、评估、过滤、训练格式转换),OpenDCAI/DataFlex 作为训练后端跑可配置的微调流程。作者强调「动态训练」不是上传即更新权重,而是可重复的数据→验证→转换→增量训练闭环。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →