DatologyAI 生成 12 万亿合成 token,四个瓶颈的工程解法全公开
AI Engineer · youtube · 2026-10-03
AI Engineer World's Fair 2026 演讲,DatologyAI 联合创始人兼 CTO Bogdan Gaza 分享万亿级合成数据流水线的工程经验:
- 背景:互联网可用文本约 30 万亿 token,前沿预训练需要更多;他们近期一次任务生成了约 12 万亿 token,覆盖网页、数学与代码。
- BeyondWeb 配方:基于 rephrasing(改写)的合成数据方法,种子化改写优于让模型从零生成。
- 技术栈演进:从 Slurm/Kubernetes 混合架构迁移到基于 EKS on HyperPod 的统一 Ray + KubeRay + vLLM 流水线。
- 四大瓶颈与解法:
- S3 元数据批量抓取:9-11 天缩短到约 2 小时;
- GPU 故障:合理分区 + checkpointing 保证可恢复;
- 跨集群 CPU/GPU 联合调度;
- vLLM 参数扫描带来约 40% 推理吞吐提升。
完整章节与 BeyondWeb 论文链接见原视频。
「Infra」频道最新
- 单张 L40S 批量渲染多路画面,voxlap 移植 CUDA 实时流式输出 — idanbeck · 2026-10-03
- 招股书披露:Anthropic 十年将投超 5180 亿美元建 AI 基础设施 — Beth_Kindig · 2026-10-03
- LibLayaX 开源:本地每秒 670 次决策的 Laya 模型多语言库 — felipedaragon · 2026-10-03
- 模型频繁更新杀死项目:自训路由器达不到新版 GLM 水平 — gaviniboom · 2026-10-03
- INT21 两工程师指挥 AI 两周造 20 个推理引擎,比 SGLang 快 2.4 倍 — bingxu_ · 2026-10-03
- Traversal 提出「自动驾驶生产」五级框架,直指编码 Agent 调试难题 — AI Engineer · 2026-10-03