数据中心/云端

借助 NVIDIA TensorRT Model Connect,在两个命令中部署从检查点到推理的开放模型

开放 AI 模型的发展速度远超以往,但将其引入本地应用仍然需要模型特定的转换、预处理、后处理和运行时代码。

NVIDIA TensorRT Model Connect 开放的参考实现集合有助于应对这一挑战。TensorRT Model Connect 将向您展示如何在原生 C++ 应用中使用 NVIDIA TensorRT 运行受支持的模型。您可以使用、检查、修改和扩展实现。Model Connect 旨在支持运行 TensorRT 的开放模型生态系统。

本文将解释什么是 NVIDIA TensorRT Model Connect,以及如何使用两个命令将模型从 Hugging Face 模型 ID 部署到原生 C++ 推理。它还介绍了 TensorRT Model Connect 提供的两个 API 级别、如何集成自定义 GPU 内核,以及如何构建项目以与开放模型生态系统保持同步。

如何通过两个命令将模型 ID 部署到原生 C++ 推理

将模型投入生产并不需要深厚的编译器专业知识。Model Connect 将部署分为两个阶段,这两个阶段之间只有一个构件。

1. 构建捆绑包 (Python CLI)

对于受支持的模型,第一阶段是根据 Hugging Face 模型 ID 或本地检查点构建部署包:

trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle

该捆绑包包含 TensorRT 引擎和运行时所需的模型特定素材。

2. 加载并运行 (C++)

在第二阶段,原生 C++ 应用程序随后加载捆绑包,并处理任务级输入和输出:

#include <trtmc/pipeline.h>
auto pipeline = trtmc::load("qwen3-0.6b.bundle");
auto result   = pipeline->generate("Explain why native inference matters.", {.max_new_tokens = 20});
std::cout << result.text << std::endl;

Model Connect 可处理检查点映射、TensorRT 引擎构建、预处理、运行时编排和后处理。您从完整的工作实现开始,而不是为每个模型系列重建此集成。

您可以使用 Python 准备模型,但已部署的应用程序无需在生产运行时使用 PyTorch 或 Python 解释器即可在本地运行。

两个 API 级别,一个起点

Model Connect 提供两个级别的 C++ API。借助语义 API,您可以处理熟悉的输入和输出,例如提示词、图像和音频,而 Model Connect 则处理特定模型的预处理、执行和后处理。

如果您需要更多控制,可以使用模块级 API 直接使用命名张量和单个 TensorRT 组件来自定义推理工作流。这两个 API 使用相同的 Model Connect 实现,因此您可以从简单的任务级接口开始,并仅在需要时自定义工作流。

扩展 TensorRT 模型使用自定义内核连接

TVM FFI 提供了一个与语言无关的接口,用于调用 GPU 内核,而无需将调用系统与内核的实现框架或运行时紧密合。通过 自带内核教程 使用 TVM FFI,您可以将模型的目标部分替换为自定义 GPU 内核,同时 TensorRT 继续执行推理工作流的其余部分。这使得集成专用或新开发的内核变得更加容易,而无需围绕单独的运行时重建应用程序。如需了解成功示例,请参阅自带内核教程

开放模型生态系统的参考实现

Model Connect 不是新的推理框架,也不是 TensorRT 的替代品。它是开放模型端到端推理体验与 TensorRT 将计算图形转换为 GPU 上加速引擎的能力之间的桥梁。

每个模型的实现有三个目的:

  • 在支持 TensorRT 的原生应用中运行受支持的开放模型
  • 从模型及其推理工作流的完整、可检查的实现中学习
  • 扩展相关架构、自定义检查点或应用程序要求的实现

这为更广泛的生态系统提供了从模型 ID 部署 TensorRT 的更清晰路径。应用程序开发者可以从工作代码开始。社区贡献者可以重复使用现有模式来增加对新模型的支持,而不是从零开始。

目标很简单:只要有可用的 TensorRT,您就应该为受支持的开放模型提供一致的 Model Connect 路径。

以原生方式构建 AI,与开放模型保持同步

开放模型生态系统变化迅速。新的架构和检查点不断出现,因此参考库必须以同样快的速度发展。

Model Connect 是一个 AI 原生软件项目。编码智能体在人类指导和审查下生成实施代码、测试、集成和文档。这使该项目能够并行开发和验证多个模型实现,同时保持一致的架构和用户体验。

Model Connect 使用夜间版本来缩短从新模型、用户报告或贡献到可用实现的路径。自动验证仍然是发布的关键。更快的节奏有助于更快地为您提供新模型支持、修复和 UX 改进。

提供完整的 TensorRT 工作流程

Model Connect 基于 TensorRT 构建,因此性能仍然至关重要。对于受支持和验证的工作负载,Model Connect 可以提供比 torch.compile 更快的推理速度,并且每个实施都会随着项目的发展而不断测试和优化。

性能不应以牺牲可用性为代价。Model Connect 整合了完整的工作流程:查找模型 ID、构建模型、从 C++ 加载模型,并在需要时进行调整。您可以获得高性能 TensorRT 推理的可访问路径,同时保留检查、自定义和优化底层推理工作流的能力。

开始使用 NVIDIA TensorRT Model Connect

访问 NVIDIA/TensorRT-Model-Connect GitHub 存储库,查找受支持的实现并构建模型包。按原样使用实现,根据您的应用进行调整,或者提供支持,帮助下一位开发者将另一个开放模型引入 TensorRT。

想要使用无需复杂设置的 AI 原生快速入门?在您可以访问的任何文件夹中打开终端,然后将以下提示粘贴到编码代理中。只需几分钟即可完成部署。

/goal Clone https://github.com/NVIDIA/TensorRT-Model-Connect.git into 
a new TensorRT-Model-Connect directory in the current workspace. Detect 
the current GPU compute capability, modify the repository development Docker 
image, build and start the container, install TensorRT-Model-Connect, compile 
the CLI, TensorRT backend, and all native model DSOs only for that SM, then 
build and run an end-to-end Qwen/Qwen3-0.6B smoke test. Do not commit or push 
changes. Report the result of the test, show exact command, input and output of 
the inference run.

如需详细了解模型覆盖范围、架构详情和完整的开发者指南,请参阅 TensorRT Model Connect 文档

标签