NVIDIA BioNeMo 推理运行时:蛋白质结构预测吞吐量提升 2.9 倍
AllThingsApx · x · 2026-09-11
NVIDIA 技术博客介绍 BioNeMo Inference Runtime(BioIR),用于在 GPU 上加速生物分子结构预测模型,同时保留熟悉的 PyTorch 工作流。
- 端到端处理器:覆盖输入解析、tokenization、特征生成、GPU 推理到 PDB/mmCIF 输出,也支持直接集成 PyTorch 模块用于自定义代码。
- 高吞吐设计:Ray executor 在单节点每块 GPU 上放置完整模型副本,通过 CPU 阶段与 GPU 折叠重叠提升吞吐。
- 实测数据:在 8xH100 上对 1000 个人类二聚体目标的基准测试中,BioIR 加速的 Boltz-2 达到每 GPU 小时 5.85 万残基,对比 torch-compiled 开源实现的 2.02 万,吞吐提升 2.90 倍。
- 三层优化:kernel 选择、CUDA Graph 捕获的模块优化、Ray 副本的流水线扩展,分别针对不同瓶颈。
- 能耗:折叠一百万个同类目标的估计能耗为 11 MWh,对比公开实现的 35 MWh。
所属事件:NVIDIA 开源 BioNeMo 推理运行时公测(8 条相关)→
「Infra」频道最新
- DeepSeek 新模型技术报告:KV Cache 较 DSV4-Flash 缩小 4 倍,训练更稳定 — stochasticchasm · 2026-09-11
- 博主点评新模型技术报告:基准成绩惊人,KV 缓存缩小 4 倍 — stochasticchasm · 2026-09-11
- Reflect Orbital 即将首射卫星,想把阳光当商品卖给缺光地区 — kyliebytes · 2026-09-11
- 推理瓶颈演化史:从权重加载到 KV 读取,取决于上下文长度 — YouJiacheng · 2026-09-11
- GPU 和内存之后轮到 CPU:AI Agent 工具调用引发 CPU 短缺 — The Pragmatic Engineer · 2026-09-11
- 开发者晒训练仪表盘:成本约 $11/百万 token,MFU 高得离谱 — jon_durbin · 2026-09-11