La capacidad de las infografías para organizar y utilizar estratégicamente señales visuales para aclarar conceptos complicados las ha hecho esenciales para una comunicación eficiente. Las infografías incluyen varios elementos visuales como cuadros, diagramas, ilustraciones, mapas, tablas y diseños de documentos. Esta ha sido una técnica de larga data que hace que el material sea más fácil de entender. Las interfaces de usuario (UI) en plataformas móviles y de escritorio comparten conceptos de diseño y lenguajes visuales con infografías en el mundo digital moderno.
Aunque existe mucha superposición entre las interfaces de usuario y las infografías, la complejidad de cada una dificulta la creación de un modelo cohesivo. Es difícil desarrollar un modelo único que pueda analizar e interpretar de manera eficiente la información visual codificada en píxeles debido a la complejidad requerida para comprender, razonar e interactuar con los diversos aspectos de las infografías y las interfaces de usuario.
Para abordar esto, en una investigación reciente de Google, un equipo de investigadores propuso ScreenAI como una solución. ScreenAI es un modelo de visión-lenguaje (VLM) que tiene la capacidad de comprender completamente tanto las interfaces de usuario como las infografías. Se han incluido en su alcance tareas como la respuesta gráfica a preguntas (QA), que puede contener gráficos, imágenes, mapas y más.
El equipo ha compartido que ScreenAI puede gestionar trabajos como anotación de elementos, resumen, navegación y control de calidad adicional específico de la interfaz de usuario. Para lograr esto, el modelo combina el método de parcheo flexible tomado de Pix2struct con la arquitectura PaLI, que le permite abordar tareas relacionadas con la visión convirtiéndolas en texto o problemas de imagen a texto.
Se han realizado varias pruebas para demostrar cómo estas decisiones de diseño afectan la funcionalidad del modelo. Tras la evaluación, ScreenAI produjo nuevos resultados de última generación en tareas como Multipage DocVQA, WebSRC, MoTIF y Widget Captioning con menos de 5 mil millones de parámetros. Logró un rendimiento notable en tareas que incluyen DocVQA, InfographicVQA y Chart QA, superando a modelos de tamaño comparable.
El equipo ha puesto a disposición tres conjuntos de datos adicionales: Screen Annotation, ScreenQA Short y Complex ScreenQA. Uno de estos conjuntos de datos se centra específicamente en la tarea de anotación en pantalla para futuras investigaciones, mientras que los otros dos conjuntos de datos se centran en la respuesta a preguntas, ampliando así aún más los recursos disponibles para avanzar en el campo.
El equipo ha resumido sus principales contribuciones de la siguiente manera:
- El concepto ScreenAI del modelo visión-lenguaje (VLM) es un paso hacia una solución holística que se centra en la comprensión de la infografía y la interfaz de usuario. Al utilizar el lenguaje visual común y el diseño sofisticado de estos componentes, ScreenAI ofrece un método integral para comprender el material digital.
- Un avance significativo es el desarrollo de una representación textual para las interfaces de usuario. Durante la etapa de preentrenamiento, esta representación se ha utilizado para enseñar al modelo cómo comprender las interfaces de usuario, mejorando su capacidad para comprender y procesar datos visuales.
- Para crear automáticamente datos de capacitación a escala, ScreenAI ha utilizado LLM y la nueva representación de la interfaz de usuario, lo que hace que la capacitación sea más efectiva y completa.
- Se han lanzado tres nuevos conjuntos de datos: Screen Annotation, ScreenQA Short y Complex ScreenQA. Estos conjuntos de datos permiten una evaluación comparativa exhaustiva del modelo para la respuesta a preguntas en pantalla y la representación textual sugerida.
- ScreenAI ha superado a los modelos más grandes por un factor de diez o más en cuatro puntos de referencia de control de calidad de infografías públicas, incluso con su bajo número de 4,6 mil millones de parámetros.
Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y noticias de Google. Unirse nuestro SubReddit de 37k+ ML, 41k+ comunidad de Facebook, Canal de discordiay LinkedIn Grarriba.
Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..
No olvides unirte a nuestro Canal de telegramas
Tanya Malhotra es estudiante de último año de la Universidad de Estudios de Petróleo y Energía, Dehradun, y cursa BTech en Ingeniería en Ciencias de la Computación con especialización en Inteligencia Artificial y Aprendizaje Automático.
Es una entusiasta de la Ciencia de Datos con buen pensamiento analítico y crítico, junto con un ardiente interés en adquirir nuevas habilidades, liderar grupos y gestionar el trabajo de manera organizada.