TensorRT Model Connect 开源发布,两条命令接入 HF 模型推理
JFPuget · x · 2026-08-19
NVIDIA 开源发布 TensorRT Model Connect(Public Preview):支持的 HuggingFace 模型仅需两条命令即可完成端到端 TensorRT 推理,无需中间 ONNX 导出,产物可通过原生 C++ API 运行。整个项目(模型实现、性能调优、测试、集成与文档)由 OpenAI Codex agent 编写、人类负责指导与审查。
TVM 作者陈天奇转发强调,本版本首次一等支持 TVM-FFI,可将自定义 DSL 内核与 agent 生成的内核带入 TensorRT 推理。官方教程展示了如何用 TVM-FFI 内核替换 Qwen3-8B 图中的部分节点,或用 CuTe DSL 内核替换 DistilBERT 区域,全程无需写 TensorRT C++。教程分两级路径:推荐级直接选模型家族发布的版本化 recipe;高级级可手工检查原始图并指定节点 ID。两级共用同一后端校验逻辑,DSO 不存入 bundle,可在构建新 pipeline 时重新绑定 ABI 兼容的实现。
所属事件:英伟达开源 TensorRT Model Connect,两条命令部署 HF 模型(2 条相关)→
「Infra」频道最新
- OpenRouter 缓存 Token 占比升至 74%,Agent 工作流驱动增长 — zainhas · 2026-08-19
- 台积电美投资增至 2650 亿美元,主攻 2nm — ocean_protocol · 2026-08-19
- Stable Diffusion 管道架构深度解析:编排能力决定产品上限 — Mahmoud_Zalt · 2026-08-19
- Supabase-js 新增 Traces 追踪功能 — dshukertjr · 2026-08-19
- Linear 重构 Delta Sync 读路径详解 — dejavucoder · 2026-08-19
- Qdrant 对比 ACORN:可过滤 HNSW 查询性能完胜 — qdrant_engine · 2026-08-19