开源项目 DataFlow:把预训练前的数据清洗与合成做成可复用流水线
Puzzleheaded_Box2842 · reddit · 2026-09-18
预训练在模型训练开始前就依赖大量数据工程:原始数据需要清洗、过滤、去重、质量评估并转成统一格式。噪声和重复会直接影响最终数据集质量,但这类工作重复且难以省略。
开源项目 OpenDCAI/DataFlow 围绕可复用算子(operator)与流水线(pipeline)组织这些工作:
- 每个算子通过统一接口处理单一任务,pipeline 串联各步骤并保存中间结果
- 可在同一工作流中组合规则过滤、模型评估与基于 LLM 的数据合成
- 典型流水线包括空白/HTML 清理、语言与长度检查、黑名单过滤、MinHash 去重、质量打分,再生成 QA 对或 SFT 数据等结构化样本
- 算子可替换、重排或扩展,无需重写整个流程
「Infra」频道最新
- 开发者用 CUDA 现算几何,跑出 2.3km 无资产程序化城市 — techartist_ · 2026-09-18
- 开源 Bonsai Swarm:浏览器标签页共享 GPU 组网跑 27B 模型 — airesearch12 · 2026-09-18
- 开发者称开源模型已达 SOTA,前沿双雄优势只剩 5GW 算力 — ccerrato147 · 2026-09-18
- 博通推 VMware 私有 AI 云,瞄准公有云 AI 账单失控的企业 — DavidLinthicum · 2026-09-18
- 仅 0.05% 采样就能验证缓存,作者感叹整个系统省下的工作量惊人 — DanielLockyer · 2026-09-18
- TRL 新增异步 GRPO:经 HF Buckets 同步 LoRA 权重,训练耗时 3.5 小时缩至 53 分钟 — _lewtun · 2026-09-18