TensorRT Model Connect 开源发布,两条命令接入 HF 模型推理

JFPuget · x · 2026-08-19

NVIDIA 开源发布 TensorRT Model Connect(Public Preview):支持的 HuggingFace 模型仅需两条命令即可完成端到端 TensorRT 推理,无需中间 ONNX 导出,产物可通过原生 C++ API 运行。整个项目(模型实现、性能调优、测试、集成与文档)由 OpenAI Codex agent 编写、人类负责指导与审查。

TVM 作者陈天奇转发强调,本版本首次一等支持 TVM-FFI,可将自定义 DSL 内核与 agent 生成的内核带入 TensorRT 推理。官方教程展示了如何用 TVM-FFI 内核替换 Qwen3-8B 图中的部分节点,或用 CuTe DSL 内核替换 DistilBERT 区域,全程无需写 TensorRT C++。教程分两级路径:推荐级直接选模型家族发布的版本化 recipe;高级级可手工检查原始图并指定节点 ID。两级共用同一后端校验逻辑,DSO 不存入 bundle,可在构建新 pipeline 时重新绑定 ABI 兼容的实现。

所属事件:英伟达开源 TensorRT Model Connect,两条命令部署 HF 模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →