Falcata:CUDA原生重写GBDT训练循环,比LightGBM快14倍
srchvrs · x · 2026-08-18
- LightGBM式leaf-wise生长是严格串行循环(一次直方图、一次分裂,每棵树重复数千次),在GPU上意味着每步一次kernel launch和主机-设备同步,显卡大部分时间在等待指令。
- @kronerfelix 与作者基于LightGBM fork出Falcata:每个level用单次batched launch完成整层生长,且可证明产出的树与逐叶学习器完全一致——「leaf-wise的树,level-wise的launch次数」。
- 同一张单卡、held-out质量持平或更好条件下:比XGBoost快2.4x、比CatBoost快4.7x、比LightGBM快14x。
- 旗舰工作负载为Numerai(680万行×3555特征)数据集。
「Infra」频道最新
- AWS 推出 OpenClaw 代理框架,集成 Bedrock 支付功能 — kleffew94 · 2026-08-18
- UBS 预估英伟达日赚 10 亿美元自由现金流 — BenBajarin · 2026-08-18
- Google DeepMind 团队发布《如何扩展模型》技术书 — philhchen · 2026-08-18
- 实测 RTX 5090 跑 Qwen3.8 27B:长上下文速度依然稳定 — _-_David · 2026-08-18
- 16GB 显存跑 Qwen3.8-27B 提速到 20 tok/s 的调优指南 — BassAzayda · 2026-08-18
- Brex 榜单:今年增长最快的初创公司超半数做 AI 基建 — mattturck · 2026-08-18