¿Los modelos CLIP ‘repiten como loros’ el texto de las imágenes?  Este artículo explora el sesgo de detección de texto en los sistemas visión-lenguaje

En una investigación reciente, un equipo de investigadores examinó CLIP (Preentrenamiento de imágenes y lenguaje contrastivo), que es una famosa red neuronal que adquiere conceptos visuales de manera efectiva mediante la supervisión del lenguaje natural. CLIP, que predice el fragmento de texto más relevante dada una imagen, ha ayudado a avanzar en las tareas de modelado de visión y lenguaje. Aunque la eficacia de CLIP se ha establecido como un modelo fundamental para una serie de aplicaciones diferentes, los modelos CLIP muestran sesgos relacionados con el texto visual, el color, el género, etc.

Un equipo de investigadores del Laboratorio de IA de Shanghai, el Show Lab, la Universidad Nacional de Singapur y la Universidad Sun Yat-Sen han examinado el sesgo del texto visual de CLIP, particularmente con respecto a su capacidad para identificar texto en fotografías. El equipo estudió en detalle el conjunto de datos LAION-2B y descubrió que estimar el sesgo con precisión es difícil dado el enorme volumen de datos de imágenes y texto.

Se utilizó la agrupación de imágenes en el conjunto de datos completo para resolver el problema, clasificando cada grupo según las puntuaciones CLIP. Este análisis tiene como objetivo determinar qué tipos de pares de imagen y texto son los más favorecidos según las medidas de puntuación CLIP. Se han incluido muchos ejemplos con las puntuaciones CLIP más altas, que consisten en texto denso contemporáneo que aparece a nivel de píxel tanto en los pies de foto como en las imágenes.

Los subtítulos que coinciden con las muestras se han denominado ‘Subtítulos de loros’ ya que parecen darle a CLIP otra forma de lograr sus objetivos enseñándole a reconocer texto sin necesariamente captar las nociones visuales. El equipo ha estudiado el significado de las leyendas de los loros examinando el conjunto de datos desde tres ángulos: el conjunto de datos en sí, los modelos populares que se han publicado y el procedimiento de entrenamiento del modelo.

El equipo ha descubierto un sesgo notable en la forma en que se describe el material de texto visual incrustado en las imágenes en los subtítulos de LAION-2B. Han descubierto que más del 50% de las fotografías tienen contenido de texto visual al perfilar minuciosamente el conjunto de datos LAION-2B utilizando métodos comerciales de detección de texto. Su análisis de datos de imágenes y texto emparejados ha demostrado que más del 90% de los subtítulos tienen al menos una palabra que aparece simultáneamente, y el título y el texto manchado de las imágenes tienen una superposición de palabras de aproximadamente el 30%. Esto sugiere que cuando se entrena con datos de estilo LAION, CLIP se desvía significativamente de la presunción fundamental de congruencia semántica entre imagen y texto.

El estudio ha analizado los sesgos en los modelos CLIP publicados, concretamente un sesgo significativo a favor de la detección de texto en diferentes tipos de fotografías web. El equipo comparó las puntuaciones de alineación antes y después de la eliminación del texto para examinar cómo se comporta el modelo CLIP disponible públicamente de OpenAI en el conjunto de datos LAION-2B. Los hallazgos han demostrado una fuerte asociación entre el texto visual incorporado en las imágenes con las correspondientes leyendas de loros y las predicciones del modelo CLIP.

El equipo también demostró las capacidades de detección de texto de los modelos CLIP y OpenCLIP y descubrió que OpenCLIP, que fue entrenado en LAION-2B, muestra un mayor sesgo a favor de la detección de texto que CLIP, que fue entrenado en WIT-400M. La investigación se ha centrado en cómo los modelos CLIP pueden adquirir rápidamente habilidades de reconocimiento de texto a partir de leyendas de loros, pero tienen problemas para establecer la conexión entre la visión y la semántica del lenguaje.

Con base en parámetros orientados al texto, como la proporción de texto incrustado, las proporciones de palabras contemporáneas y las puntuaciones CLIP relativas de la eliminación de texto, se han muestreado varios subconjuntos de LAION-2B. Los hallazgos han demostrado que los modelos CLIP obtienen buenas capacidades de detección de texto cuando se entrenan con datos de subtítulos de loros, pero pierden la mayor parte de su capacidad de generalización cero en tareas posteriores de imagen-texto.

En conclusión, este estudio se ha centrado en los efectos de las leyendas de loros en el aprendizaje del modelo CLIP. Ha arrojado luz sobre los sesgos asociados con el texto visual en los subtítulos de LAION-2B y ha enfatizado el sesgo de detección de texto en los modelos CLIP publicados.


Revisar la Papel y Proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de más de 35.000 ml, 41k+ comunidad de Facebook, Canal de discordia, LinkedIn Grarribay Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.


Tanya Malhotra es estudiante de último año de la Universidad de Estudios de Petróleo y Energía, Dehradun, y cursa BTech en Ingeniería Informática con especialización en Inteligencia Artificial y Aprendizaje Automático.
Es una entusiasta de la Ciencia de Datos con buen pensamiento analítico y crítico, junto con un ardiente interés en adquirir nuevas habilidades, liderar grupos y gestionar el trabajo de manera organizada.