蚂蚁 OmniTable 获 VLDB 最佳论文:35PB 语料准备提速 5.6 倍
量子位 · wechat · 2026-09-03
蚂蚁集团的论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获 VLDB 2026 工业赛道最佳论文,介绍其管理超 35PB、3050 亿条大模型训练数据的统一宽表系统。
核心设计与成果:
- 「逻辑统一、物理分离」:每数据域呈现为一张逻辑宽表(Web 宽表约 25PB、800+ 逻辑列),底层按需拆分,列级血缘全程可追溯
- 特征回刷改为「报目标列」,系统自动沿依赖 DAG 生成最小执行计划;算子融合把 8 次扫描并为 1 次,CPU 时减少 55.9%
- 记录级容错:单条坏样本不再拖垮整批,0.005% 异常率的任务一次跑完,省去约 52 小时的排查重跑
- 真实 SFT 数据准备任务从约 14 天缩短到 2.5 天,手工步骤从 45 降至 12
论文指出代价:热点列物化增加 8%–15% 存储,记录级包装增加 3%–5% 执行开销。
「Infra」频道最新
- Reliance Jio 推云电脑 JioPC,每天 11 卢比虚拟一台 PC — NirantK · 2026-09-03
- Arm CEO 对谈:从 IP 授权到造芯,CPU 仍是 AI 时代心脏 — No Priors · 2026-09-03
- 开源项目 ARBR:给多模型流量加路由与治理层,自动降本不掉质 — Genie-Tickle-007 · 2026-09-03
- Arm CEO 做客 No Priors:从 IP 授权转向造芯,为 Meta 打造 AGI CPU — No Priors · 2026-09-03
- 4060 Ti 16GB 跑 27B 模型 6-7 t/s,本地推理还能怎么榨速度 — thatoneshadowclone · 2026-09-03
- ClickHouse CEO:Agent 查询模式不可预测,延迟成可观测性关键 — bibryam · 2026-09-03