NVIDIA BioNeMo 推理运行时提速 2.9 倍:Boltz-2 折叠吞吐达 58.5K 残基/GPU 时
PyTorch · x · 2026-09-18
NVIDIA 发布技术博客,介绍 BioNeMo Inference Runtime(BioIR)如何加速生物分子结构预测模型,同时保持 PyTorch 原生工作流。
核心数据(8xH100 上 1000 个人类二聚体基准):
- BioIR 加速的 Boltz-2 达到 58.5K 成功折叠残基/GPU 小时,对比 torch.compile 开源实现的 20.2K,吞吐提升 2.90 倍
- 折叠 100 万个目标的估算能耗从 35 MWh 降至 11 MWh
三层优化:
- 核心算子选择(optimized kernels)
- 用 CUDA Graph 捕获做模块级优化
- 用 Ray 副本做流水线扩展,单节点内每块 GPU 放完整模型副本,CPU 阶段与 GPU 折叠重叠执行
支持 Boltz-2、OpenFold2、OpenFold3,端到端覆盖解析、tokenize、特征生成、GPU 推理到 PDB/mmCIF 输出,也可作为 torch.nn.Module 集成进自定义代码。
「Infra」频道最新
- 开源模型落地下一个瓶颈是存储:2027 年或成 HDD 大爆发之年 — cocktailpeanut · 2026-09-18
- p0 Parallel Search 上线 Baseten,为开源模型提供低价联网搜索 — baseten · 2026-09-18
- Neon 后端正式 GA:面向应用与 Agent 的数据库原语全家桶 — matei_zaharia · 2026-09-18
- 三元权重 27B 模型 Bonsai 2 不足 6GB,WebGPU 浏览器内可跑 — xenovatech · 2026-09-18
- HyperQwen 项目招募 4090/5090 用户优化 Qwen 本地推理速度 — iamMess · 2026-09-18
- REBCO 高温超导带材:50 特斯拉磁场背后的稀土供应链 — Anen-o-me · 2026-09-18