La IA generativa mejora un sistema de visión inalámbrico que ve a través de obstáculos | Noticias del MIT

Los investigadores del MIT han pasado más de una década estudiando técnicas que permiten a los robots encontrar y manipular objetos ocultos “viendo” a través de los obstáculos. Sus métodos utilizan señales inalámbricas que penetran la superficie y se reflejan en elementos ocultos.

Ahora, los investigadores están aprovechando modelos de inteligencia artificial generativa para superar un cuello de botella de larga data que limitaba la precisión de enfoques anteriores. El resultado es un nuevo método que produce reconstrucciones de formas más precisas, lo que podría mejorar la capacidad de un robot para agarrar y manipular de manera confiable objetos que están bloqueados a la vista.

Esta nueva técnica construye una reconstrucción parcial de un objeto oculto a partir de señales inalámbricas reflejadas y completa las partes faltantes de su forma utilizando un modelo de IA generativa especialmente entrenado.

Los investigadores también introdujeron un sistema ampliado que utiliza IA generativa para reconstruir con precisión una habitación entera, incluidos todos los muebles. El sistema utiliza señales inalámbricas enviadas desde un radar estacionario, que se reflejan en los humanos que se mueven en el espacio.

Esto supera un desafío clave de muchos métodos existentes, que requieren montar un sensor inalámbrico en un robot móvil para escanear el entorno. Y a diferencia de algunas técnicas populares basadas en cámaras, su método preserva la privacidad de las personas en el entorno.

Estas innovaciones podrían permitir que los robots de almacén verifiquen los artículos empaquetados antes de enviarlos, eliminando el desperdicio de las devoluciones de productos. También podrían permitir que los robots domésticos inteligentes comprendan la ubicación de alguien en una habitación, mejorando la seguridad y la eficiencia de la interacción entre humanos y robots.

“Lo que hemos hecho ahora es desarrollar modelos de IA generativa que nos ayudan a comprender los reflejos inalámbricos. Esto abre muchas aplicaciones nuevas e interesantes, pero técnicamente también es un salto cualitativo en capacidades, desde poder llenar vacíos que no podíamos ver antes hasta poder interpretar reflejos y reconstruir escenas enteras”, dice Fadel Adib, profesor asociado en el Departamento de Ingeniería Eléctrica e Informática, director del grupo Signal Kinetics en el MIT Media Lab y autor principal de dos artículos sobre estas técnicas. “Estamos utilizando la IA para desbloquear finalmente la visión inalámbrica”.

En el primer artículo se unen a Adib la autora principal y asistente de investigación Laura Dodds; así como los asistentes de investigación Maisy Lam, Waleed Akbar y Yibo Cheng; y en el segundo artículo del autor principal y ex postdoctorado Kaichen Zhou; Dodds; y el asistente de investigación Sayed Saad Afzal. Ambos artículos se presentarán en la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones.

Superar la especularidad

El Grupo Adib demostró previamente el uso de señales de ondas milimétricas (mmWave) para crear reconstrucciones precisas de objetos 3D que están ocultos a la vista, como una billetera perdida enterrada debajo de una pila.

Estas ondas, que son el mismo tipo de señales utilizadas en Wi-Fi, pueden atravesar obstrucciones comunes como paneles de yeso, plástico y cartón, y reflejarse en objetos ocultos.

Pero las ondas mm suelen reflejarse de manera especular, lo que significa que una onda se refleja en una sola dirección después de golpear una superficie. Por lo tanto, grandes porciones de la superficie reflejarán señales lejos del sensor mmWave, haciendo que esas áreas sean efectivamente invisibles.

“Cuando queremos reconstruir un objeto, sólo podemos ver la superficie superior y no podemos ver la parte inferior ni los lados”, explica Dodds.

Los investigadores utilizaron previamente principios de la física para interpretar las señales reflejadas, pero esto limita la precisión de la forma 3D reconstruida.

En los nuevos artículos, superaron esa limitación utilizando un modelo de IA generativa para completar las partes que faltan en una reconstrucción parcial.

“Pero el desafío entonces es: ¿cómo se entrenan estos modelos para llenar estos vacíos?” dice Adib.

Por lo general, los investigadores utilizan conjuntos de datos extremadamente grandes para entrenar un modelo de IA generativa, que es una de las razones por las que modelos como Claude y Llama exhiben un rendimiento tan impresionante. Pero ningún conjunto de datos mmWave es lo suficientemente grande para el entrenamiento.

En cambio, los investigadores adaptaron las imágenes en grandes conjuntos de datos de visión por computadora para imitar las propiedades de los reflejos de mmWave.

“Estábamos simulando la propiedad de la especularidad y el ruido que obtenemos de estas reflexiones para poder aplicar conjuntos de datos existentes a nuestro dominio. Nos habría llevado años recopilar suficientes datos nuevos para hacer esto”, afirma Lam.

Los investigadores incorporan la física de los reflejos de ondas milimétricas directamente en estos datos adaptados, creando un conjunto de datos sintéticos que utilizan para enseñar a un modelo de IA generativa a realizar reconstrucciones de formas plausibles.

El sistema completo, llamado Wave-Former, propone un conjunto de posibles superficies de objetos basadas en reflejos de mmWave, las alimenta al modelo de IA generativa para completar la forma y luego refina las superficies hasta lograr una reconstrucción completa.

Wave-Former pudo generar reconstrucciones fieles de alrededor de 70 objetos cotidianos, como latas, cajas, utensilios y frutas, lo que aumentó la precisión en casi un 20 por ciento con respecto a las bases de referencia de última generación. Los objetos estaban escondidos detrás o debajo de cartón, madera, paneles de yeso, plástico y tela.

Ver “fantasmas”

El equipo utilizó este mismo enfoque para construir un sistema ampliado que reconstruya completamente escenas interiores enteras aprovechando los reflejos de ondas milimétricas de los humanos que se mueven en una habitación.

El movimiento humano genera reflexiones multitrayecto. Algunas ondas milimétricas se reflejan en el ser humano, luego se reflejan nuevamente en una pared u objeto y luego regresan al sensor, explica Dodds.

Estos reflejos secundarios crean las llamadas “señales fantasma”, que son copias reflejadas de la señal original que cambian de ubicación a medida que un humano se mueve. Estas señales fantasma normalmente se descartan como ruido, pero también contienen información sobre la distribución de la habitación.

“Al analizar cómo estos reflejos cambian con el tiempo, podemos empezar a tener una comprensión aproximada del entorno que nos rodea. Pero intentar interpretar directamente estas señales tendrá una precisión y resolución limitadas”. dice Dodds.

Utilizaron un método de entrenamiento similar para enseñar a un modelo de IA generativo a interpretar esas reconstrucciones de escenas aproximadas y comprender el comportamiento de los reflejos de ondas mm de trayectos múltiples. Este modelo llena los vacíos, refinando la reconstrucción inicial hasta completar la escena.

Probaron su sistema de reconstrucción de escenas, llamado RISE, utilizando más de 100 trayectorias humanas capturadas por un solo radar mmWave. En promedio, RISE generó reconstrucciones que fueron aproximadamente el doble de precisas que las técnicas existentes.

En el futuro, los investigadores quieren mejorar la granularidad y el detalle de sus reconstrucciones. También quieren construir grandes modelos básicos para señales inalámbricas, como los modelos básicos GPT, Claude y Gemini para lenguaje y visión, que podrían abrir nuevas aplicaciones.

Este trabajo cuenta con el apoyo, en parte, de la National Science Foundation (NSF), el MIT Media Lab y Amazon.