Nuevo punto de referencia para evaluar sistemas multimodales basados en datos de vídeo, audio y texto del mundo real
Desde el prueba de Turing a ImagenNet, los puntos de referencia han desempeñado un papel fundamental en la configuración de la inteligencia artificial (IA) al ayudar a definir los objetivos de la investigación y permitir a los investigadores medir el progreso hacia esos objetivos. Avances increíbles en los últimos 10 años, como alexnet en visión por computadora y AlfaFold en el plegamiento de proteínas, se han relacionado estrechamente con el uso de conjuntos de datos de referencia, lo que permite a los investigadores clasificar el diseño del modelo y las opciones de entrenamiento, e iterar para mejorar sus modelos. A medida que trabajamos hacia el objetivo de construir inteligencia artificial general (AGI), desarrollar puntos de referencia sólidos y efectivos que amplíen las capacidades de los modelos de IA es tan importante como desarrollar los modelos mismos.
La percepción (el proceso de experimentar el mundo a través de los sentidos) es una parte importante de la inteligencia. Y crear agentes con una comprensión perceptiva del mundo a nivel humano es una tarea central pero desafiante, que se está volviendo cada vez más importante en la robótica, los automóviles autónomos, los asistentes personales, las imágenes médicas y más. Así que hoy presentamos el Prueba de percepciónun punto de referencia multimodal que utiliza videos del mundo real para ayudar a evaluar las capacidades de percepción de un modelo.
Desarrollar un punto de referencia de percepción
Actualmente se utilizan muchos puntos de referencia relacionados con la percepción en la investigación de IA, como Cinética para reconocimiento de acciones de vídeo, Conjunto de audio para clasificación de eventos de audio, AGUDEZA para el seguimiento de objetos, o VQA para preguntas y respuestas sobre imágenes. Estos puntos de referencia han llevado a un progreso sorprendente en cómo se construyen y desarrollan las arquitecturas de modelos de IA y los métodos de entrenamiento, pero cada uno solo apunta a aspectos restringidos de la percepción: los puntos de referencia de imágenes excluyen aspectos temporales; la respuesta visual a preguntas tiende a centrarse en la comprensión de la escena semántica de alto nivel; Las tareas de seguimiento de objetos generalmente capturan la apariencia de nivel inferior de objetos individuales, como el color o la textura. Y muy pocos puntos de referencia definen tareas en modalidades tanto de audio como de visual.
Modelos multimodales, como Perceptor, Flamencoo BEiT-3, pretenden ser modelos de percepción más generales. Pero sus evaluaciones se basaron en múltiples conjuntos de datos especializados porque no había ningún punto de referencia específico disponible. Este proceso es lento, costoso y proporciona una cobertura incompleta de las capacidades de percepción general como la memoria, lo que dificulta a los investigadores comparar métodos.
Para abordar muchos de estos problemas, creamos un conjunto de datos de videos diseñados específicamente de actividades del mundo real, etiquetados según seis tipos diferentes de tareas:
- Seguimiento de objetos: Se proporciona un cuadro alrededor de un objeto al principio del video, el modelo debe devolver una pista completa a lo largo de todo el video (incluso a través de oclusiones).
- Seguimiento de puntos: Si se selecciona un punto al principio del vídeo, el modelo debe seguir el punto a lo largo del vídeo (también a través de oclusiones).
- Localización de acciones temporales: el modelo debe localizar y clasificar temporalmente un conjunto predefinido de acciones.
- Localización temporal del sonido: el modelo debe localizar y clasificar temporalmente un conjunto predefinido de sonidos.
- Video de respuesta a preguntas de opción múltiple: Preguntas textuales sobre el vídeo, cada una con tres opciones entre las que seleccionar la respuesta.
- Vídeo fundamentado de preguntas y respuestas: preguntas textuales sobre el video, el modelo debe devolver una o más pistas de objetos.
Nos inspiramos en la forma en que se evalúa la percepción de los niños en la psicología del desarrollo, así como en conjuntos de datos sintéticos como ABASTECER y MÁS INTELIGENTEy diseñó 37 guiones de vídeo, cada uno con diferentes variaciones para garantizar un conjunto de datos equilibrado. Cada variación fue filmada por al menos una docena de participantes (similar al trabajo anterior en Charadas y Algo algo), con un total de más de 100 participantes, dando como resultado 11.609 vídeos, con una duración media de 23 segundos.
Los vídeos muestran juegos sencillos o actividades diarias, que nos permitirían definir tareas que requieren las siguientes habilidades para resolver:
- Conocimientos de semántica: probar aspectos como la finalización de tareas, el reconocimiento de objetos, acciones o sonidos.
- Comprensión de la física: colisiones, movimiento, oclusiones, relaciones espaciales.
- Razonamiento temporal o memoria: Ordenamiento temporal de eventos, conteo en el tiempo, detección de cambios en una escena.
- Habilidades de abstracción: coincidencia de formas, nociones iguales/diferentes, detección de patrones.
Los participantes de fuentes colectivas etiquetaron los videos con anotaciones espaciales y temporales (pistas de cuadros delimitadores de objetos, pistas de puntos, segmentos de acción, segmentos de sonido). Nuestro equipo de investigación diseñó las preguntas por tipo de guión para las tareas de respuesta a preguntas en video fundamentadas y de opción múltiple para garantizar una buena diversidad de habilidades evaluadas, por ejemplo, preguntas que prueban la capacidad de razonar contrafácticamente o de proporcionar explicaciones para una situación determinada. Las respuestas correspondientes a cada vídeo fueron proporcionadas nuevamente por participantes colaborativos.
Evaluación de sistemas multimodales con el Test de Percepción
Suponemos que los modelos han sido entrenados previamente en conjuntos de datos y tareas externos. La prueba de percepción incluye un pequeño conjunto de ajustes (20%) que los creadores del modelo pueden utilizar opcionalmente para transmitir la naturaleza de las tareas a los modelos. Los datos restantes (80%) consisten en una división de validación pública y una división de prueba en espera donde el rendimiento solo se puede evaluar a través de nuestro servidor de evaluación.
Aquí mostramos un diagrama de la configuración de la evaluación: las entradas son una secuencia de video y audio, además de una especificación de la tarea. La tarea puede ser en forma de texto de alto nivel para responder preguntas visualmente o ingresar un nivel bajo, como las coordenadas del cuadro delimitador de un objeto para la tarea de seguimiento de objetos.
Los resultados de la evaluación se detallan en varias dimensiones y medimos las habilidades en las seis tareas computacionales. Para las tareas visuales de respuesta a preguntas, también proporcionamos un mapeo de preguntas en los tipos de situaciones que se muestran en los videos y los tipos de razonamiento necesarios para responder las preguntas para un análisis más detallado (consulte nuestro papel para más detalles). Un modelo ideal maximizaría las puntuaciones en todos los gráficos de radar y en todas las dimensiones. Se trata de una evaluación detallada de las habilidades de un modelo, lo que nos permite delimitar áreas de mejora.
Garantizar la diversidad de participantes y escenas mostradas en los videos fue una consideración crítica al desarrollar el punto de referencia. Para hacer esto, seleccionamos participantes de diferentes países de diferentes etnias y géneros y buscamos tener una representación diversa dentro de cada tipo de guión de video.
Más información sobre el Test de Percepción
El punto de referencia de la prueba de percepción está disponible públicamente aquí y más detalles están disponibles en nuestro papel. Próximamente también estarán disponibles una tabla de clasificación y un servidor de desafíos.
El 23 de octubre de 2022, organizaremos una taller sobre modelos de percepción general en la Conferencia Europea sobre Visión por Computador en Tel Aviv (ECVC 2022), donde discutiremos nuestro enfoque y cómo diseñar y evaluar modelos de percepción general con otros expertos líderes en el campo.
Esperamos que la prueba de percepción inspire y oriente futuras investigaciones hacia modelos de percepción general. En el futuro, esperamos colaborar con la comunidad de investigación multimodal para introducir anotaciones, tareas, métricas o incluso nuevos lenguajes adicionales en el punto de referencia.
Ponte en contacto enviando un correo electrónico prueba-percepción@google.com si estás interesado en contribuir!