北大开源 RayOrch:数据准备管线最高提速 15.14 倍
PekingUniversity · hf · 2026-09-28
- 北京大学团队发布 RayOrch,一个面向基础模型训练数据准备的编程模型与分布式执行引擎,已开源。
- 核心问题:高质量训练数据管线要把异构文档/视频展开为父子结构记录,现有系统要么把并行性藏在粗粒度作业后面,要么只暴露扁平记录,迫使应用自行管理血缘(lineage)与重分组。
- RayOrch 在执行全程保留父子关系:程序声明有序的变基数扩展与配套 gather,编译器校验配对,运行时记录子项成员、父项、顺序与终态;按 Call 的 FIFO 就绪队列跨父项批处理,Gather 依据声明式成员与序号重建结果;父项在全部所需子项终态后即可推进,类型化的父作用域失败会抑制该父项未调度的兄弟子项而不影响其他父项。
- 性能(在 NVIDIA H20 上):MinerU 管线从 4 卡扩到 64 卡获得 15.14 倍加速;视频管线 8→64 卡获得 7.82 倍加速。端到端耗时对比 Ray Data 与 Daft:MinerU 上分别降低 13.1% 与 29.0%,Docling 上比 Ray Data 降低 16.0%。
- 代码:github.com/OpenDCAI/RayOrch
「Infra」频道最新
- FailureAtlas 论文:多厂商 LLM 网关最致命的故障是静默返回 HTTP 200 — its_vayishu · 2026-09-28
- 二手 RTX 3090 涨到近 1500 美元,买家直呼像 GPU 抢椅子游戏 — sleight42 · 2026-09-28
- Strix Halo 跑 Qwen 3.8 Flash Next:换 gufo 推理,预处理速度翻倍于 llama.cpp 分支 — fallingdowndizzyvr · 2026-09-28
- 爬虫服务 p50 稳定 2 秒,作者强调应用与数据库必须同区部署 — DanielLockyer · 2026-09-28
- 算力生意里为什么信用质量最关键:集群不透明,只能盯出钱的人 — AccBalanced · 2026-09-28
- AMD 首款可买到的 Gorgon Halo 芯片 495,较 395 提升有限 — julianharris · 2026-09-28