La IA ha avanzado en el procesamiento del lenguaje, las matemáticas y la generación de código, pero extender estas capacidades a entornos físicos sigue siendo desafiante. La IA física busca cerrar esta brecha mediante el desarrollo de sistemas que perciban, comprendan y actúen en entornos dinámicos del mundo real. A diferencia de la IA convencional que procesa texto o símbolos, la IA física se involucra con entradas sensoriales, especialmente videos, y genera respuestas basadas en la física del mundo real. Estos sistemas están diseñados para la navegación, la manipulación y la interacción, dependiendo del razonamiento de sentido común y una comprensión encarnada del espacio, el tiempo y las leyes físicas. Las aplicaciones abarcan robótica, vehículos autónomos y colaboración de máquinas humanas, donde la adaptabilidad a la percepción en tiempo real es crucial.
La conexión débil de los modelos de IA actuales con la física del mundo real es una limitación importante. Si bien funcionan bien en las tareas abstractas, a menudo no pueden predecir las consecuencias físicas o responder adecuadamente a los datos sensoriales. Los conceptos como la gravedad o las relaciones espaciales no se entienden intuitivamente, lo que los hace poco confiables para las tareas encarnadas. La capacitación directamente en el mundo físico es costoso y arriesgado, lo que obstaculiza el desarrollo y la iteración. Esta falta de base física y comprensión encarnada es una barrera significativa para desplegar IA de manera efectiva en aplicaciones del mundo real.
Anteriormente, las herramientas para el razonamiento físico en IA estaban fragmentadas. Los modelos en idioma de visión vincularon datos visuales y textuales, pero carecían de profundidad en el razonamiento. Los sistemas basados en reglas fueron rígidos y fallaron en escenarios novedosos. Las simulaciones y los datos sintéticos a menudo pierden los matices de la física del mundo real. Críticamente, no había un marco estandarizado para definir o evaluar el sentido común físico o el razonamiento incorporado. Las metodologías y puntos de referencia inconsistentes hicieron que el progreso fuera difícil de cuantificar. Los enfoques de aprendizaje de refuerzo carecían de estructuras de recompensas específicas de la tarea, lo que condujo a modelos que luchaban con el razonamiento de causa y efecto y la viabilidad física.
Investigadores de Nvidia introdujeron Cosmos-Rason1un conjunto de modelos de lenguaje grande multimodal. Estos modelos, Cosmos-Rason1-7b y Cosmos-Rason1-56bfueron diseñados específicamente para tareas de razonamiento físico. Cada modelo está entrenado en dos fases principales: AI físico supervisado FIN (SFT) y aprendizaje físico de refuerzo de IA (RL). Lo que diferencia este enfoque es la introducción de un sistema de dual de tonificación. Una ontología jerárquica organiza el sentido común físico en tres categorías principales, espacio, tiempo y física fundamental, dividida aún más en 16 subcategorías. La segunda ontología son las capacidades de razonamiento bidimensional y mapas en cinco agentes encarnados, incluidos humanos, armas de robot, robots humanoides y vehículos autónomos. Estas ontologías son guías de entrenamiento y herramientas de evaluación para la evaluación comparativa del razonamiento físico de la IA.
La arquitectura de Cosmos-Raze1 utiliza un LLM solo decodificador aumentado con un codificador de visión. Los videos se procesan para extraer características visuales, que luego se proyectan en un espacio compartido con tokens de lenguaje. Esta integración permite que el modelo razone sobre datos textuales y visuales simultáneamente. Los investigadores seleccionaron un conjunto de datos masivo que comprende alrededor de 4 millones de pares de texto de video anotados para capacitación. Estos incluyen descripciones de acción, preguntas de opción múltiple y largos rastros de razonamiento de la cadena de pensamiento. La etapa de aprendizaje de refuerzo está impulsada por recompensas verificables basadas en reglas derivadas de preguntas de opción múltiple marcadas por humanos y tareas de video auto-supervisadas. Estas tareas incluyen predecir la dirección temporal de los videos y resolver rompecabezas con parches espaciotemporales, lo que hace que el entrenamiento sea profundamente vinculado a la lógica física del mundo real.
El equipo construyó tres puntos de referencia para el sentido común físico, el espacio, el tiempo y la física fundamental, que contiene 604 preguntas de 426 videos. Se construyeron seis puntos de referencia para un razonamiento incorporado con 610 preguntas de 600 videos, cubriendo una amplia gama de tareas. Los modelos Cosmos-Reason1 superaron a las líneas de base anteriores, especialmente después de la fase RL. En particular, mejoraron en la verificación de finalización de la tarea, prediciendo las siguientes acciones plausibles y evaluando la viabilidad física de las acciones. Estas ganancias se observaron en ambos tamaños del modelo, con Cosmos-Razon1-56b mostrando un rendimiento más fuerte en la mayoría de las métricas. Esta mejora del rendimiento subraya la efectividad del uso de ontologías estructuradas y datos multimodales para mejorar el razonamiento físico en la IA.
Varias conclusiones clave de la investigación sobre Cosmos-Rason1:
- Dos modelos introdujeron: Cosmos-Rason1-7b y Cosmos-Reason1-56b, entrenados específicamente para tareas de razonamiento físico.
- Los modelos fueron entrenados en dos fases: ajuste fino (SFT) de IA física (SFT) y aprendizaje físico de refuerzo de IA (RL).
- El conjunto de datos de entrenamiento incluye aproximadamente 4 millones de pares de texto de video anotados seleccionados para el razonamiento físico.
- El aprendizaje de refuerzo utiliza recompensas basadas en reglas y verificables, derivadas de anotaciones humanas y tareas basadas en videos.
- El equipo se basó en dos ontologías: una jerárquica con tres categorías y 16 subcategorías, y una capacidades de agente de mapeo bidimensional.
- Puntos de referencia: 604 preguntas de 426 videos para sentido común físico y 610 de 600 videos para razonamiento incorporado.
- Se observaron ganancias de rendimiento en todos los puntos de referencia después del entrenamiento de RL, particularmente en la predicción de las próximas acciones y verificar la finalización de la tarea.
- Aplicabilidad del mundo real para robots, vehículos y otros agentes encarnados en diversos entornos.
En conclusión, la iniciativa Cosmos-Reason1 demuestra cómo la IA puede estar mejor equipada para el mundo físico. Aborda limitaciones clave en la percepción, el razonamiento y la toma de decisiones que han obstaculizado el progreso en la implementación de IA en escenarios encarnados. La tubería de entrenamiento estructurada, basada en datos del mundo real y marcos ontológicos, asegura que los modelos sean precisos y adaptables. Estos avances indican un gran paso adelante para cerrar la brecha entre el razonamiento de IA abstracto y las necesidades de los sistemas que deben operar en entornos impredecibles y del mundo real.
Mira el Papel, Página del proyecto, Modelos en la cara abrazada y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 95k+ ml de subreddit y suscribirse a Nuestro boletín.
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.