Tomó por asalto el mundo de la conducción autónoma con su nueva arquitectura AlpamayoR1 que integra un gran modelo de visión y lenguaje como columna vertebral de razonamiento causal. Este lanzamiento, acompañado de un nuevo conjunto de datos a gran escala y un simulador de conducción fotorrealista, ya posiciona a la empresa como uno de los principales actores en este campo en 2026.
En este artículo, analizaremos la arquitectura de AlpamayoR1, el razonamiento de la cadena de causalidad y el elaborado procedimiento de entrenamiento utilizado para entrenar el modelo.
El estado actual de la conducción autónoma
El lanzamiento de AlpamayoR1 (AR1) encuentra contexto en el paradigma actual de las arquitecturas de extremo a extremo (E2E). Los modelos E2E tienen como objetivo mapear entradas sensoriales sin procesar (cámaras, LiDAR, radar,…) a trayectorias en una arquitectura completamente diferenciable optimizando un objetivo unificado.
Una tendencia emergente en E2E implica aprovechar el amplio conocimiento mundial de los grandes modelos de visión y lenguaje (VLM) para abordar situaciones de conducción complejas. Esto generalmente implica el uso de VLM como columna vertebral de razonamiento para informar trayectorias futuras o como profesores expertos para proporcionar señales de supervisión a modelos de estudiantes más pequeños.
La arquitectura AR1
AR1 es un excelente ejemplo del enfoque de razonamiento VLM como columna vertebral. A pesar de su enorme tamaño, la arquitectura está optimizada para la implementación en el mundo real y ejecuta una latencia de 99 ms o 10 Hz en una única GPU BlackWell, que se considera un objetivo general por razones de seguridad. En esta sección, analizaremos la arquitectura y sus numerosas innovaciones.
Codificador de visión
AR1 utiliza entradas visuales y textuales en forma de transmisiones de cámara tokenizadas e instrucciones en lenguaje natural. Para el rendimiento, es fundamental que el codificador de visión produzca la menor cantidad de tokens posible.
Para ello, los autores utilizaron un Vision Transformer (ViT)[2] para tokenización de una sola imagen. Los ViT dividen imágenes en una secuencia de tokens codificados por un transformador normal. Tenga en cuenta que la integración de algoritmos más eficientes como Flex [3] para la tokenización de múltiples vídeos se deja para trabajos futuros.
La columna vertebral del razonamiento
La arquitectura AR1 se basa en Cosmos-Reason, uno de los VLM de Nvidia entrenado específicamente para el razonamiento incorporado en casos de uso de IA física. Su conjunto de entrenamiento habitual incluye 3,7 millones de muestras generales de respuesta visual a preguntas (VQA) para mejorar también el conjunto físico común del modelo, complementadas con 24,7 mil muestras de conducción. Estos incluyen vídeo VQA anotado con rastros de razonamiento de DeepSeek-R1 para predecir la siguiente acción.
Cosmos-Reason procesa tokens visuales y de texto junto con la historia reciente del ego (posiciones xy pasadas y ángulo del vehículo del ego) para generar una cadena de rastros de razonamiento causal para informar trayectorias futuras.
Cadena de causalidad
Una limitación crucial de los modelos de lenguaje radica en la ambigüedad inherente de las etiquetas de texto en los conjuntos de datos visuales. Esto incluye descripciones vagas que carecen de una estructura causal. Los modelos entrenados con dichos datos exhiben una baja correlación entre sus rastros de razonamiento y las acciones predichas, así como confusión causal.
Para un agente encarnado como un automóvil autónomo, es esencial una sólida capacidad de razonamiento causal. Para evitar esos problemas, el equipo de Nvidia desplegó importantes esfuerzos para crear un conjunto de datos de conducción con anotaciones causalmente consistentes.
Específicamente, el conjunto de datos contiene clips de 20 segundos extraídos de grabaciones de conducción del mundo real en diversos entornos y países. Cada clip contiene 2 segundos de contexto que lleva a una decisión de conducción (por ejemplo, adelantar, ceder el paso, pasar una intersección,…) y sus consecuencias. La estructura causal de estos escenarios queda expuesta mediante anotaciones textuales consistentes que siguen un modelo estricto.
El primer 10% del conjunto de datos está anotado por humanos, mientras que el resto está anotado por VLM de última generación como GPT5 para escalar el proceso de etiquetado. Una vez más, se despliegan importantes esfuerzos para garantizar la coherencia, la calidad y la corrección de estas anotaciones humanas y de IA.
Decodificador de trayectoria
El último paso del pase hacia adelante consiste en decodificar las huellas del razonamiento en una trayectoria de 64 puntos. Si bien las trayectorias generalmente se decodifican como una secuencia de puntos de referencia (coordenadas xy), el equipo de Nvidia descubrió que el uso de dinámicas de monociclo (es decir, generar una secuencia de valores de aceleración y ángulos de dirección) producía resultados más consistentes. En particular, facilita la tarea de aprendizaje al evitar que el modelo prediga trayectorias físicamente imposibles (por ejemplo, que el punto t esté demasiado lejos del punto t+1).
Curiosamente, los autores adoptan una representación dual de la trayectoria en la que el modelo genera de forma autorregresiva tokens discretos durante el entrenamiento y utiliza la coincidencia de flujo para generar una trayectoria continua en el momento de la inferencia. Las principales razones detrás de este diseño son las siguientes:
Espacio conjunto de tokens de acción y razonamiento: el uso de tokens de acción discretos permite un acoplamiento más estrecho entre los rastros de razonamiento y las acciones. Cuando el modelo genera una traza de razonamiento, los siguientes tokens de la secuencia (aceleración y curvaturas) se vinculan matemáticamente a esa explicación, evitando alucinaciones. Facilitar la optimización de RL: restringir el conjunto de posibles tokens de acción a un conjunto discreto hace que la optimización de RL sea significativamente más fácil. De hecho, muestrear el token correcto de un vocabulario discreto (por ejemplo, ACCEL_NEG_2) es significativamente más fácil que proporcionar un gradiente para un valor continuo como -2,145 m/s^2. Como veremos en la siguiente sección, esto permite el postentrenamiento de RL, lo cual es crucial para mejorar la seguridad y consistencia del modelo. Señal de supervisión más fuerte: el uso de una pérdida de entropía cruzada en tokens discretos actúa como una tarea de clasificación y captura mejor la multimodalidad (por ejemplo, la clara probabilidad de girar hacia la izquierda o hacia la derecha) que una pérdida de MSE en coordenadas. Coincidencia de flujo para inferencia: si bien los tokens discretos son excelentes para el aprendizaje, generalmente resultan en trayectorias entrecortadas. Además, generar una secuencia de 128 tokens de forma autorregresiva es demasiado lento para realizar inferencias en tiempo real. Para abordar esas limitaciones, los autores presentan un experto en acción: una variante más pequeña de la arquitectura principal que utiliza el caché KV (que contiene tokens visuales, movimientos históricos y rastros de razonamiento) para decodificar una trayectoria continua en una sola pasada mediante difusión de coincidencia de flujo. Esta es una de las razones principales por las que AR1 puede ejecutarse con una latencia tan baja.
Ajuste fino supervisado y post-entrenamiento de RL
Para transformar la columna vertebral de VLM en una política de conducción eficiente, se somete a un ajuste supervisado (SFT) en el conjunto de datos de la cadena de causalidad. Específicamente, aprende a reproducir las huellas del razonamiento y las acciones de verdad fundamentales asociadas maximizando la probabilidad logarítmica de la secuencia acción-razonamiento:
Sin embargo, la OFV por sí sola no es suficiente. Los VLM sufren notoriamente discrepancias entre su razonamiento y sus acciones previstas. La naturaleza estática de los conjuntos de datos de bucle abierto permite que el modelo imite rastros de razonamiento, pero la falta de retroalimentación ambiental les impide internalizar verdaderamente las reacciones causales.
Afortunadamente, el entrenamiento posterior de RL ayuda a aliviar esas limitaciones al proporcionar comentarios de inferencia sobre las implementaciones del modelo. En este artículo, los autores utilizan RL para tres propósitos principales:
Mejora de la calidad del razonamiento: un modelo de razonamiento grande (por ejemplo, DeepSeek-R1) evalúa los rastros de razonamiento de AR1 para garantizar que no haya inconsistencias ni alucinaciones y asigna una recompensa discreta en una escala de 0 a 5 en consecuencia. Si bien no se espera que DeepSeek pueda generar rastros de razonamiento de alta calidad para conducir, es mucho más fácil evaluar el razonamiento de AR1, esto se conoce como la brecha de verificación de generación. Hacer cumplir la coherencia razonamiento-acción: los autores extraen metaacciones (acelerar, dirigir, ir recto,…) del conjunto de datos de CoC utilizando sistemas basados en reglas. Si esas metaacciones corresponden a las mencionadas en los rastros de razonamiento, el modelo recibe una recompensa adicional de 1; de lo contrario, 0. Calidad de la trayectoria: una recompensa de trayectoria mide la distancia L2 entre la trayectoria predicha y la experta, penaliza las trayectorias que conducen a colisiones y sacudidas de alta magnitud.
Durante el entrenamiento posterior, AR1 genera múltiples implementaciones paralelas y recopila recompensas r_i en función de las tres señales de recompensa anteriores. Estas recompensas se utilizan luego para calcular la pérdida de GRPO. [4]. GRPO calcula la ventaja de cada implementación en relación con el promedio del grupo. Este enfoque sin línea de base (a diferencia de otros algoritmos de RL como PPO) estabiliza el entrenamiento al recompensar las rutas de razonamiento que superan a sus contrapartes para la misma entrada, en lugar de depender de una puntuación absoluta arbitraria.
Todo lo que necesitas entender acerca de este objetivo es que apunta a maximizar la probabilidad de trayectorias (el término logarítmico) con una alta ventaja (el término softmax) en relación con otras. Para evitar perder los antecedentes visión-lenguaje del VLM y los conocimientos de conducción obtenidos durante la SFT, el objetivo se regulariza mediante una divergencia KL entre la política actual y la referencia (la política obtenida al final de la SFT).
Evaluación
El protocolo de evaluación incluye 4 apartados: predicción de trayectoria en bucle abierto, simulación en bucle cerrado, estudios de ablación y pruebas en carretera en vehículos. Si bien el hecho de que AR1 se haya implementado en escenarios del mundo real es impresionante, en mi opinión, los resultados de circuito abierto y cerrado son algo opacos; la razón principal es que se obtuvieron en conjuntos de datos de Nvidia (bucle cerrado: conjunto de datos PhysicalAI-AV, bucle cerrado: AlpaSim) publicados al mismo tiempo que el modelo. Esto implica una falta de líneas de base para contextualizar el desempeño de AR1.
Por ejemplo, los resultados de circuito cerrado solo incluyen AR1 y una línea de base sin razonamiento en 75 escenarios. Si bien AR1 supera la línea de base en todas las métricas medidas, a menudo lo hace en un solo porcentaje en promedio y con una variación mucho mayor que la línea de base.
Por esta razón, recomendaría tomar estos resultados con cautela antes de evaluar otras arquitecturas de frontera en AlpaSim.
Conclusión
A pesar de la falta de resultados contextualizados, AR1 y los conjuntos de datos que lo acompañan siguen siendo un logro de ingeniería impresionante y una buena indicación de hacia dónde se dirige la conducción autónoma: modelos de extremo a extremo que heredan el conocimiento mundial de VLM masivos entrenados en tareas incorporadas.
Sin embargo, la recopilación de conjuntos de datos con base causal necesarios para permitir la cadena de causalidad requiere importantes inversiones y esfuerzos de etiquetado, lo que limita la reproducibilidad hasta que estos conjuntos de datos se hagan públicos. En mi próximo artículo, contrastaré el enfoque AR1 con otro modelo de última generación que elimina por completo las etiquetas textuales y, en cambio, entrena a los VLM para actuar y razonar en un espacio latente.
¡Gracias por leer hasta aquí!
Si este artículo le resultó útil, considere compartirlo; Realmente ayuda a respaldar el tiempo y el esfuerzo que se dedican a producir este trabajo. Como siempre, no dude en ponerse en contacto conmigo si tiene preguntas, pensamientos o ideas para seguimiento. Si desea apoyar mi investigación y mis escritos independientes, no dude en invitarme a un café 😉
¡Hasta la próxima! 👋