Los grandes modelos de lenguaje, basados predominantemente en arquitecturas transformadoras, han remodelado el procesamiento del lenguaje natural. La familia de modelos LLaMA se ha convertido en un ejemplo destacado. Sin embargo, surge una pregunta fundamental: ¿se puede aplicar eficazmente la misma arquitectura de transformador para procesar imágenes 2D? Este artículo presenta VisionLLaMA, un transformador de visión diseñado para cerrar la brecha entre las modalidades del lenguaje y la visión. En este artículo, exploramos los aspectos clave de VisionLLaMA, desde su arquitectura y principios de diseño hasta su desempeño en diversas tareas de visión.
VisionLLaMA sigue de cerca la línea de Vision Transformer (ViT) conservando el diseño arquitectónico de LLaMA. La imagen se segmenta en parches que no se superponen y se procesa a través de bloques VisionLLaMA, que incluyen características como la autoatención mediante codificaciones posicionales rotativas (RoPE) y la activación de SwiGLU. En particular, VisionLLaMA se diferencia de ViT al depender únicamente de la codificación posicional inherente de su bloque básico.
El artículo se centra en dos versiones de VisionLLaMA: transformadores planos y piramidales. La variante simple es consistente con la arquitectura ViT, mientras que la variante piramidal investiga la extensión de VisionLLaMA a transformadores basados en ventanas (Twins). El propósito no es construir nuevos transformadores piramidales, sino mostrar cómo VisionLLaMA se adapta a los diseños existentes, mostrando adaptabilidad en todas las arquitecturas.
Numerosos experimentos evalúan el rendimiento de VisionLLaMA en la generación, clasificación, segmentación y detección de imágenes. VisionLLaMA se ha incorporado al marco de difusión DiT para la generación de imágenes y al marco del modelo generativo SiT para evaluar sus méritos en la arquitectura del modelo. Los resultados muestran que VisionLLaMA tiene un rendimiento consistente en todos los tamaños de modelos, lo que valida su eficiencia como columna vertebral de la visión. Las opciones de diseño de VisionLLaMA, como el uso de SwiGLU, técnicas de normalización, relaciones de codificación posicional y métodos de abstracción de características, se investigan en estudios de ablación. El estudio ofrece información sobre la confiabilidad y eficiencia de las partes constituyentes de VisionLLaMA, dirigiendo las decisiones sobre su implementación.
Los experimentos se pueden resumir como:
- Generación de imágenes en marcos de difusión DiT y SiT
- Clasificación en el conjunto de datos ImageNet-1K
- Segmentación semántica en el conjunto de datos ADE20K
- Detección de objetos en COCO
Se compararon los resultados del entrenamiento supervisado y autosupervisado y los modelos se ajustaron en consecuencia.
En la sección de discusión se puede encontrar un análisis adicional de los mecanismos subyacentes que permiten el rendimiento mejorado de VisionLLaMA. Se destacan la técnica de codificación posicional del modelo y la información sobre cómo afecta la velocidad de convergencia y el rendimiento general. La flexibilidad proporcionada por RoPE se destaca como un factor esencial para aprovechar eficientemente la capacidad del modelo.
El artículo propone VisionLLaMA como una arquitectura atractiva para tareas de visión, sentando las bases para futuras investigaciones. La exploración de sus capacidades en diversas aplicaciones sugiere otras posibilidades, como expandir las capacidades de VisionLLaMA más allá del texto y la visión para crear una arquitectura de modelo más inclusiva y adaptable.
En conclusión, VisionLLaMA proporciona una arquitectura perfecta que atraviesa modalidades y une el vínculo entre el lenguaje y la visión. En conjunto, su justificación teórica, validación experimental y opciones de diseño resaltan la capacidad de VisionLLaMA para impactar significativamente las tareas del campo de visión. La versión de código abierto promueve mucho más la investigación cooperativa y la creatividad en el campo de los grandes transformadores de visión.
Revisar la Papel y GitHub. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y noticias de Google. Unirse nuestro SubReddit de 38k+ ML, 41k+ comunidad de Facebook, Canal de discordiay LinkedIn Grarriba.
Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..
No olvides unirte a nuestro Canal de telegramas
También te puede gustar nuestro Cursos GRATUITOS de IA….
Vibhanshu Patidar es pasante de consultoría en MarktechPost. Actualmente cursa una licenciatura en el Instituto Indio de Tecnología (IIT) Kanpur. Es un entusiasta de la robótica y el aprendizaje automático con una habilidad especial para desentrañar las complejidades de los algoritmos que unen la teoría y las aplicaciones prácticas.