NVIDIA ha lanzado TensorRT Model Connect (TRTMC) en versión preliminar pública, un proyecto de código abierto que toma una Hugging Face compatible o un punto de control local para realizar una inferencia de TensorRT de un extremo a otro en dos comandos. No existe un paso intermedio de exportación de ONNX. La compilación produce un artefacto .bundle versionado que se ejecuta a través de API de tareas nativas de C++, por lo que la inferencia se puede ejecutar en un servicio de C++, una aplicación integrada o una pila de robótica sin PyTorch en la ruta de tiempo de ejecución. El proyecto tiene licencia Apache-2.0 y se envía como una colección de implementaciones de referencia de propiedad familiar en lugar de un único convertidor genérico. NVIDIA también afirma que todo el proyecto (implementaciones de modelos, ajuste de rendimiento, pruebas, integraciones y documentos) se creó utilizando agentes OpenAI Codex bajo dirección y revisión humana.
¿Es desplegable?
Sí, para trabajos de evaluación e integración nativa, con condiciones reales. El código es abierto e instalable. Actualmente, las ruedas de lanzamiento están dirigidas únicamente a Linux aarch64, con Python 3.10 o 3.12, glibc 2.39 o posterior y TensorRT 11.1.0.106. Las ruedas x86_64 no están publicadas; Los usuarios de x86_64 deben tomar la ruta de compilación de origen de Docker.
Nivel de empresa: la mejor opción hoy en día son los equipos que ya poseen su pila de inferencia: empresas emergentes de tiendas NVIDIA, empresas de robótica y dispositivos, y equipos de plataforma o inferencia dentro de empresas medianas y grandes. Los equipos pequeños que envían un servicio Python obtienen menos beneficios. Las empresas reguladas deben esperar una versión etiquetada antes de estandarizarla. Industrias: robótica y máquinas autónomas, inspección y fabricación industrial, computación en vehículos automotrices, dispositivos médicos, sistemas de defensa y aeroespaciales, y procesamiento de medios; en cualquier lugar, la inferencia debe residir dentro de un binario C++ en lugar de un servidor Python. Aplicaciones: Generación de texto en el dispositivo, reconocimiento y síntesis de voz, OCR y análisis de documentos, incrustaciones y reclasificación para un servicio de recuperación escrito en C++, generación de imágenes y videos de difusión, segmentación y pronóstico de series temporales.
Los dos comandos
El inicio rápido construye y ejecuta Qwen3-0.6B:
trtmc build Qwen/Qwen3-0.6B –precision bf16 –max-cache-length 16384 –output qwen3-0.6b.bundle trtmc run ./qwen3-0.6b.bundle –prompt “¿Cuál es la capital de Francia? Responda en una palabra”. –plantilla-chat –sin-pensar
El mismo .bundle se carga desde C++ con trtmc::load(“./qwen3-0.6b.bundle”).
El paquete es la decisión de diseño real.
TRTMC divide la compilación y el tiempo de ejecución en un artefacto versionado. Python posee resolución de punto de control y construcción de motor TensorRT. Luego, los perfiles nativos ejecutan inferencia en C++ sin PyTorch. Una pequeña cantidad de perfiles híbridos invocan un ejecutable auxiliar de Python y sus manifiestos declaran esa dependencia explícitamente.
Las aplicaciones llaman a las API de tareas (generar(), transcribir(), generar_imagen(), embed(), resolver()) en lugar de mantener las etapas de conversión y el pegamento de la aplicación por modelo. trtmc inspect expone el tipo de paquete, la familia de modelos, la precisión, la identidad del tiempo de ejecución y los motores, lo que hace que el artefacto sea auditable en lugar de opaco.
NVIDIA enmarca la ruta convencional como PyTorch → ONNX o TorchScript → TensorRT → integración de C++ específica del modelo, y nombra los modos de falla que elimina: brechas de exportación, integración repetida por modelo y validación distribuida en varios artefactos de conversión.
Conclusiones clave
Dos comandos llevan un punto de control de Hugging Face compatible a la inferencia nativa de C++ TensorRT, sin ningún paso ONNX. Un .bundle versionado es el traspaso entre la compilación de Python y un tiempo de ejecución de C++ sin PyTorch. La instantánea GB300 del 29 de julio de 2026 cubre 105 perfiles en 76 familias; 102 superaron en más de un 5% su referencia declarada. Wheels son Linux aarch64 solo hoy; x86_64 requiere la compilación fuente de Docker.
Consulte el repositorio de GitHub. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.