时间:2026年8月18日
地点:美国
人物:NVIDIA工程团队
事件详情:
NVIDIA于8月18日发布TensorRT Model Connect(TRTMC)公测版,这是一款开源工具,可将Hugging Face或本地模型检查点通过两条命令直接转换为原生C++推理引擎,全程无需导出中间格式ONNX。构建产物为版本化的.bundle文件,通过C++任务API(generate、transcribe、embed等)执行推理,运行时无需PyTorch环境。
TRTMC提供了面向105个模型系列、76个模型家族的参考实现,涵盖Qwen、Llama、Mistral、DeepSeek等主流模型。2026年7月29日的GB300快照显示,102个profile的性能较其声明基准提升超过5%。整个项目在人类监督下由OpenAI Codex Agent构建完成,采用Apache-2.0许可。
背景:
传统TensorRT部署路径为:PyTorch → ONNX/TorchScript → TensorRT → 模型专用C++集成,需跨多个转换阶段且各阶段验证分散。TRTMC将构建阶段与运行时分离:Python负责模型解析和TensorRT引擎构建,原生C++ runtime直接执行推理,两者通过.bundle交接。
影响:
TRTMC主要面向已有推理栈的团队(NVIDIA系初创、机器人/嵌入式厂商、中大型企业推理团队),在机器人、汽车车载计算、医疗设备、防御系统和边缘AI推理场景尤为适用。相比Python服务,在C++二进制内运行推理可实现更低延迟、更小部署体积。
总结:
NVIDIA发布TRTMC标志着其推理工具链全面向Agent化工作流升级——从模型构建到生产部署的门槛大幅降低,Hugging Face生态与NVIDIA推理优化实现无缝衔接。
参考来源:
1. https://www.marktechpost.com/2026/08/18/nvidia-releases-tensorrt-model-connect-in-public-preview-hugging-face-checkpoint-to-native-c-inference-in-two-commands/
2. https://github.com/NVIDIA/TensorRT-Model-Connect
3. https://nvidia.github.io/TensorRT-Model-Connect/
4. https://github.com/NVIDIA/TensorRT-Model-Connect/releases/tag/trtmc-nightly-20260814T132928Z-75e25af75499









