Google DeepMind lanza Gemini Robotics-ER 1.6: lleva el razonamiento incorporado mejorado y la lectura de instrumentos a la IA física

El equipo de investigación de Google DeepMind presentó Gemini Robotics-ER 1.6, una mejora significativa de su modelo de razonamiento incorporado diseñado para servir como “cerebro cognitivo” de robots que operan en entornos del mundo real. El modelo se especializa en capacidades de razonamiento críticas para la robótica, incluida la comprensión visual y espacial, la planificación de tareas y la detección de éxito, actuando como modelo de razonamiento de alto nivel para un robot, capaz de ejecutar tareas llamando de forma nativa a herramientas como la Búsqueda de Google, modelos de visión, lenguaje y acción (VLA) o cualquier otra función definida por el usuario de terceros.

Aquí está la idea arquitectónica clave que debemos comprender: Google DeepMind adopta un enfoque de modelo dual para la IA robótica. Gemini Robotics 1.5 es el modelo visión-lenguaje-acción (VLA): procesa entradas visuales e indicaciones del usuario y las traduce directamente en comandos motores físicos. Gemini Robotics-ER, por otro lado, es el modelo de razonamiento encarnado: se especializa en comprender espacios físicos, planificar y tomar decisiones lógicas, pero no controla directamente las extremidades robóticas. En cambio, proporciona información de alto nivel para ayudar al modelo VLA a decidir qué hacer a continuación. Piense en ello como la diferencia entre un estratega y un ejecutor: Gemini Robotics-ER 1.6 es el estratega.

https://deepmind.google/blog/gemini-robotics-er-1-6/?

Novedades de Gemini Robotics-ER 1.6

Gemini Robotics-ER 1.6 muestra una mejora significativa con respecto a Gemini Robotics-ER 1.5 y Gemini 3.0 Flash, mejorando específicamente las capacidades de razonamiento espacial y físico, como señalar, contar y detectar éxito. Pero la adición clave es una capacidad que no existía en versiones anteriores: la lectura de instrumentos.

Señalar como base para el razonamiento espacial

Señalar (la capacidad del modelo para identificar ubicaciones precisas a nivel de píxeles en una imagen) es mucho más poderoso de lo que parece. Los puntos se pueden utilizar para expresar el razonamiento espacial (detección y conteo de objetos con precisión), lógica relacional (hacer comparaciones como identificar el elemento más pequeño de un conjunto o definir relaciones desde y hacia como ‘mover X a la ubicación Y’), razonamiento de movimiento (mapear trayectorias e identificar puntos de agarre óptimos) y cumplimiento de restricciones (razonamiento a través de indicaciones complejas como “señale cada objeto lo suficientemente pequeño como para caber dentro de la taza azul”).

https://deepmind.google/blog/gemini-robotics-er-1-6/?

En las pruebas internas, Gemini Robotics-ER 1.6 demuestra una clara ventaja sobre su predecesor. Gemini Robotics-ER 1.6 identifica correctamente la cantidad de martillos, tijeras, pinceles, alicates y herramientas de jardín en una escena, y no señala los elementos solicitados que no están presentes en la imagen, como una carretilla y un taladro Ryobi. En comparación, Gemini Robotics-ER 1.5 no logra identificar la cantidad correcta de martillos o pinceles, omite por completo las tijeras y alucina con una carretilla. Para los profesionales de AI Robotics, esto es importante porque las detecciones de objetos alucinados en tuberías robóticas pueden causar fallas en cascada: un robot que “ve” un objeto que no está allí intentará interactuar con el espacio vacío.

Detección de éxito y razonamiento multivista

En robótica, saber cuándo ha finalizado una tarea es tan importante como saber cómo iniciarla. La detección de éxito sirve como un motor de toma de decisiones fundamental que permite a un agente elegir de forma inteligente entre volver a intentar un intento fallido o avanzar a la siguiente etapa de un plan.

Este es un problema más difícil de lo que parece. La mayoría de las configuraciones de robótica modernas incluyen múltiples vistas de cámara, como una alimentación aérea y montada en la muñeca. Esto significa que un sistema necesita comprender cómo se combinan diferentes puntos de vista para formar una imagen coherente en cada momento y en el tiempo. Gemini Robotics-ER 1.6 avanza en el razonamiento de múltiples vistas, lo que le permite fusionar mejor la información de múltiples flujos de cámaras, incluso en entornos ocluidos o que cambian dinámicamente.

Lectura de instrumentos: un avance en el mundo real

La capacidad genuinamente nueva de Gemini Robotics-ER 1.6 es la lectura de instrumentos: la capacidad de interpretar medidores analógicos, medidores de presión, mirillas y lecturas digitales en entornos industriales. Esta tarea surge de las necesidades de inspección de las instalaciones, un área de enfoque crítica para Boston Dynamics. Spot, un robot de Boston Dynamics, puede visitar instrumentos en una instalación y capturar imágenes de ellos para que Gemini Robotics-ER 1.6 las interprete.

La lectura de instrumentos requiere un razonamiento visual complejo: uno debe percibir con precisión una variedad de entradas (incluidas las agujas, el nivel del líquido, los límites del recipiente, las marcas y más) y comprender cómo se relacionan entre sí. En el caso de las mirillas, esto implica estimar cuánto líquido llena la mirilla teniendo en cuenta la distorsión desde la perspectiva de la cámara. Los medidores suelen tener un texto que describe la unidad, que debe leerse e interpretarse, y algunos tienen varias agujas que hacen referencia a diferentes decimales que deben combinarse.

https://deepmind.google/blog/gemini-robotics-er-1-6/?

Gemini Robotics-ER 1.6 logra las lecturas de sus instrumentos mediante el uso de visión agente (una capacidad que combina el razonamiento visual con la ejecución de código, introducida con Gemini 3.0 Flash y ampliada en Gemini Robotics-ER 1.6). El modelo toma pasos intermedios: primero hacer zoom en una imagen para obtener una mejor lectura de los pequeños detalles en un medidor, luego usar el apuntamiento y la ejecución de código para estimar proporciones e intervalos y, en última instancia, aplicar el conocimiento mundial para interpretar el significado.

Gemini Robotics-ER 1.5 logra una tasa de éxito del 23 % en la lectura de instrumentos, Gemini 3.0 Flash alcanza el 67 %, Gemini Robotics-ER 1.6 alcanza el 86 % y Gemini Robotics-ER 1.6 con visión agente alcanza el 93 %. Una advertencia importante: Gemini Robotics-ER 1.5 se evaluó sin visión agente porque no admite esa capacidad. Los otros tres modelos se evaluaron con visión agente habilitada para la tarea de lectura de instrumentos, lo que hace que la línea de base del 23 % sea menos una brecha de rendimiento y más una diferencia arquitectónica fundamental. Para los desarrolladores de IA que evalúan generaciones de modelos, esta distinción es importante: no se están comparando manzanas con manzanas en toda la columna de referencia.

Conclusiones clave

Gemini Robotics-ER 1.6 es un modelo de razonamiento, no un modelo de acción: actúa como el “cerebro” de alto nivel de un robot (manejando la comprensión espacial, la planificación de tareas y la detección de éxitos), mientras que el modelo VLA separado (Gemini Robotics 1.5) maneja los comandos del motor físico real. Señalar es más poderoso de lo que parece: la capacidad de señalar de Gemini Robotics-ER 1.6 va mucho más allá de la simple detección de objetos: permite la lógica relacional, el mapeo de trayectorias de movimiento, la identificación de puntos de agarre y el razonamiento basado en restricciones, todos los cuales son fundamentales para una manipulación robótica confiable. La lectura de instrumentos es la nueva capacidad más importante: construido en colaboración con el robot Spot de Boston Dynamics para la inspección de instalaciones industriales, Gemini Robotics-ER 1.6 ahora puede leer medidores analógicos, medidores de presión y mirillas con una precisión del 93 % utilizando visión agente, en comparación con solo el 23 % en Gemini Robotics-ER 1.5, que carecía por completo de esta capacidad. La detección de éxito es lo que permite la verdadera autonomía: saber cuándo una tarea está realmente completa (a través de múltiples vistas de cámara, en entornos ocluidos o dinámicos) es lo que permite a un robot decidir si reintentar o pasar al siguiente paso sin intervención humana.

Consulte los detalles técnicos y la información del modelo. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 130.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros