Investigadores de la Universidad de Tsinghua y Zhipu AI presentan CogAgent: un modelo de lenguaje visual revolucionario para una interacción GUI mejorada

La investigación tiene sus raíces en el campo de los modelos de lenguaje visual (VLM), centrándose particularmente en su aplicación en interfaces gráficas de usuario (GUI). Esta área se ha vuelto cada vez más relevante a medida que las personas pasan más tiempo en dispositivos digitales, lo que requiere herramientas avanzadas para una interacción GUI eficiente. El estudio aborda la intersección de los LLM y su integración con las GUI, que ofrece un gran potencial para mejorar la automatización de tareas digitales.

El problema central identificado es la necesidad de una mayor eficacia de los modelos de lenguaje grandes como ChatGPT para comprender e interactuar con los elementos de la GUI. Esta limitación es un cuello de botella importante, considerando que la mayoría de las aplicaciones implican GUI para la interacción humana. La dependencia de los modelos actuales de entradas textuales debe ser más precisa a la hora de capturar los aspectos visuales de las GUI, que son fundamentales para una interacción perfecta e intuitiva entre humanos y computadoras.

Los métodos existentes aprovechan principalmente entradas basadas en texto, como contenido HTML o resultados de OCR (reconocimiento óptico de caracteres), para interpretar las GUI. Sin embargo, es necesario revisar estos enfoques para comprender de manera integral los elementos de la GUI, que son visualmente ricos y a menudo requieren una interpretación matizada más allá del análisis textual. Los modelos tradicionales necesitan ayuda para comprender los íconos, imágenes, diagramas y relaciones espaciales inherentes a las interfaces GUI.

En respuesta a estos desafíos, los investigadores de la Universidad de Tsinghua, Zhipu AI, presentaron CogAgent, un modelo de lenguaje visual de 18 mil millones de parámetros diseñado específicamente para la comprensión y navegación de GUI. CogAgent se diferencia por emplear codificadores de imágenes de alta y baja resolución. Este sistema de codificador dual permite que el modelo procese y comprenda elementos complejos de la GUI y contenido textual dentro de estas interfaces, un requisito crítico para una interacción GUI efectiva.

La arquitectura de CogAgent presenta un módulo cruzado de alta resolución único, que es clave para su rendimiento. Este módulo permite que el modelo maneje eficientemente entradas de alta resolución (1120 x 1120 píxeles), lo cual es crucial para reconocer texto y elementos pequeños de la GUI. Este enfoque aborda el problema común de administrar imágenes de alta resolución en VLM, que generalmente resultan en demandas computacionales prohibitivas. De este modo, el modelo logra un equilibrio entre el procesamiento de alta resolución y la eficiencia computacional, allanando el camino para una interpretación de GUI más avanzada.

https://arxiv.org/abs/2312.08914v1

CogAgent establece un nuevo estándar en el campo al superar los métodos existentes basados ​​en LLM en diversas tareas, particularmente en navegación GUI para plataformas PC y Android. El modelo tiene un rendimiento superior en varios puntos de referencia de respuesta a preguntas visuales generales y con texto rico, lo que indica su solidez y versatilidad. Su capacidad para superar los modelos tradicionales en estas tareas resalta su potencial para automatizar tareas complejas que implican manipulación e interpretación de GUI.

La investigación se puede resumir en pocas palabras de la siguiente manera:

  • CogAgent representa un importante avance en los VLM, especialmente en contextos que involucran GUI.
  • Su enfoque innovador para procesar imágenes de alta resolución dentro de un marco computacional manejable lo distingue de los métodos existentes.
  • El impresionante rendimiento del modelo en diversos puntos de referencia subraya su aplicabilidad y eficacia en la automatización y simplificación de tareas relacionadas con la GUI.

Revisar la Papel y GitHub. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de más de 35.000 ml, 41k+ comunidad de Facebook, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.


Hola, mi nombre es Adnan Hassan. Soy pasante de consultoría en Marktechpost y pronto seré aprendiz de gestión en American Express. Actualmente estoy cursando una doble titulación en el Instituto Indio de Tecnología, Kharagpur. Me apasiona la tecnología y quiero crear nuevos productos que marquen la diferencia.