Este artículo sobre IA de Meta FAIR presenta MoMa: una arquitectura de combinación de expertos que tiene en cuenta la modalidad para un preentrenamiento multimodal eficiente

La inteligencia artificial multimodal se centra en el desarrollo de modelos capaces de procesar e integrar diversos tipos de datos, como texto e imágenes. Estos modelos son esenciales para responder preguntas visuales y generar texto descriptivo para imágenes, lo que pone de relieve la capacidad de la IA para comprender e interactuar con un mundo multifacético. La combinación de información de diferentes modalidades permite a la IA realizar tareas complejas de forma más eficaz, lo que demuestra ser muy prometedor en la investigación y las aplicaciones prácticas.

Uno de los principales desafíos de la IA multimodal es optimizar la eficiencia del modelo. Los métodos tradicionales que fusionan codificadores o decodificadores específicos de cada modalidad suelen limitar la capacidad del modelo para integrar información de distintos tipos de datos de manera eficaz. Esta limitación genera mayores demandas computacionales y una menor eficiencia del rendimiento. Los investigadores se han esforzado por desarrollar nuevas arquitecturas que integren sin problemas datos de texto e imágenes desde el principio, con el objetivo de mejorar el rendimiento y la eficiencia del modelo en el manejo de entradas multimodales.

Los métodos existentes para manejar datos de modalidades mixtas incluyen arquitecturas que preprocesan y codifican datos de texto e imágenes por separado antes de integrarlos. Estos enfoques, si bien son funcionales, pueden requerir un gran esfuerzo computacional y pueden aprovechar solo parcialmente el potencial de la fusión temprana de datos. La separación de modalidades a menudo genera ineficiencias y la incapacidad de capturar adecuadamente las relaciones complejas entre los diferentes tipos de datos. Por lo tanto, se requieren soluciones innovadoras para superar estos desafíos y lograr un mejor rendimiento.

Para abordar estos desafíos, los investigadores de Meta introdujeron MoMa, una novedosa arquitectura de mezcla de expertos (MoE) que tiene en cuenta la modalidad y está diseñada para entrenar previamente modelos de lenguaje de fusión temprana y de modalidad mixta. MoMa procesa texto e imágenes en secuencias arbitrarias dividiendo los módulos expertos en grupos específicos de modalidad. Cada grupo maneja exclusivamente tokens designados, empleando el enrutamiento aprendido dentro de cada grupo para mantener la adaptabilidad informada semánticamente. Esta arquitectura mejora significativamente la eficiencia del preentrenamiento, con resultados empíricos que muestran ganancias sustanciales. La investigación, realizada por un equipo de Meta, muestra el potencial de MoMa para hacer avanzar los modelos de lenguaje de modalidad mixta.

La tecnología detrás de MoMa implica una combinación de técnicas de mezcla de expertos (MoE) y mezcla de profundidades (MoD). En MoE, los tokens se enrutan a través de un conjunto de bloques de retroalimentación (expertos) en cada capa. Estos expertos se dividen en grupos específicos de texto y grupos específicos de imagen, lo que permite vías de procesamiento especializadas. Este enfoque, denominado escasez consciente de la modalidad, mejora la capacidad del modelo para capturar características específicas de cada modalidad al tiempo que mantiene la integración entre modalidades a través de mecanismos de autoatención compartidos. Además, MoD permite que los tokens omitan cálculos de forma selectiva en ciertas capas, lo que optimiza aún más la eficiencia del procesamiento.

El rendimiento de MoMa se evaluó exhaustivamente y mostró mejoras sustanciales en eficiencia y eficacia. Con un presupuesto de entrenamiento de 1 billón de tokens, el modelo MoMa 1.4B, que incluye 4 expertos en texto y 4 expertos en imágenes, logró una reducción general de 3,7 veces en operaciones de punto flotante por segundo (FLOP) en comparación con una línea base densa. Específicamente, logró una reducción de 2,6 veces para el procesamiento de texto y de 5,2 veces para el procesamiento de imágenes. Cuando se combinó con MoD, el ahorro general de FLOP aumentó a 4,2 veces, con una mejora del procesamiento de texto de 3,4 veces y del procesamiento de imágenes de 5,3 veces. Estos resultados resaltan el potencial de MoMa para mejorar significativamente la eficiencia del preentrenamiento de modelos de lenguaje de fusión temprana y de modalidad mixta.

La arquitectura innovadora de MoMa representa un avance significativo en la IA multimodal. Al integrar expertos en modalidades específicas y técnicas avanzadas de enrutamiento, los investigadores han desarrollado un modelo de IA más eficiente en términos de recursos que mantiene un alto rendimiento en diversas tareas. Esta innovación aborda problemas críticos de eficiencia computacional, allanando el camino para desarrollar sistemas de IA multimodales más capaces y eficientes en términos de recursos. El trabajo del equipo demuestra el potencial para que la investigación futura se base en estas bases, explorando mecanismos de enrutamiento más sofisticados y ampliando el enfoque a modalidades y tareas adicionales.

En resumen, la arquitectura MoMa, desarrollada por investigadores de Meta, ofrece una solución prometedora a los desafíos computacionales de la IA multimodal. El enfoque aprovecha técnicas de combinación de expertos y de combinación de profundidades que tienen en cuenta la modalidad para lograr importantes ganancias de eficiencia y, al mismo tiempo, mantener un rendimiento sólido. Este avance allana el camino para la próxima generación de modelos de IA multimodal, que pueden procesar e integrar diversos tipos de datos de manera más eficaz y eficiente, mejorando la capacidad de la IA para comprender e interactuar con el mundo complejo y multimodal en el que vivimos.


Revisar la Papel. Todo el crédito por esta investigación corresponde a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de Telegram y LinkedIn Gr¡Arriba!. Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..

No olvides unirte a nuestro Más de 47 000 suscriptores de ML en Reddit

Encuentra lo próximo Seminarios web sobre IA aquí



Nikhil es consultor en prácticas en Marktechpost. Está cursando una doble titulación integrada en Materiales en el Instituto Indio de Tecnología de Kharagpur. Nikhil es un entusiasta de la IA y el aprendizaje automático que siempre está investigando aplicaciones en campos como los biomateriales y la ciencia biomédica. Con una sólida formación en ciencia de los materiales, está explorando nuevos avances y creando oportunidades para contribuir.