NVIDIA AI Libera de la serie Eagle2 Modelo de lenguaje de visión: Lograr resultados de SOTA en varios puntos de referencia multimodales

Los modelos en idioma de visión (VLM) han ampliado significativamente la capacidad de la IA para procesar información multimodal, pero enfrentan desafíos persistentes. Los modelos patentados como GPT-4V y Géminis-1.5-Pro ​​logran un rendimiento notable pero carecen de transparencia, lo que limita su adaptabilidad. Las alternativas de código abierto a menudo luchan por igualar estos modelos debido a limitaciones en la diversidad de datos, metodologías de capacitación y recursos computacionales. Además, la documentación limitada sobre las estrategias de datos posteriores al entrenamiento dificulta la replicación. Para abordar estas brechas, Nvidia Ai presenta Águila 2un VLM diseñado con un enfoque estructurado y transparente para la curación de datos y el entrenamiento de modelos.

Nvidia AI presenta Eagle 2: un marco transparente de VLM

Eagle 2 ofrece un nuevo enfoque al priorizar la apertura en su estrategia de datos. A diferencia de la mayoría de los modelos que solo proporcionan pesos capacitados, Eagle 2 detalla su recopilación de datos, filtrado, aumento y procesos de selección. Esta iniciativa tiene como objetivo equipar a la comunidad de código abierto con las herramientas para desarrollar VLM competitivos sin depender de conjuntos de datos patentados.

Eagle2-9b, el modelo más avanzado de la serie Eagle 2, se desempeña en la par con los modelos varias veces su tamaño, como aquellos con parámetros 70B. Al refinar las estrategias de datos posteriores al entrenamiento, Eagle 2 optimiza el rendimiento sin requerir recursos computacionales excesivos.

Innovaciones clave en Eagle 2

Las fortalezas de Eagle 2 provienen de tres innovaciones principales: una estrategia de datos refinados, un enfoque de capacitación en múltiples fases y una arquitectura centrada en la visión.

  1. Estrategia de datos
    • El modelo sigue un diversidad primero, luego calidad enfoque, curando un conjunto de datos de más 180 fuentes Antes de refinarlo a través del filtrado y la selección.
    • Una tubería de refinamiento de datos estructurada incluye análisis de errores, explicaciones de cadena de pensamiento (COT), generación de control de calidad basada en reglas y formateo de datos para la eficiencia.
  2. Marco de entrenamiento de tres etapas
    • Etapa 1 Alinea las modalidades de visión y lenguaje mediante la capacitación de un conector MLP.
    • Etapa 1.5 Introduce diversos datos a gran escala, reforzando la base del modelo.
    • Etapa 2 Ajunas del modelo utilizando conjuntos de datos de sintonización de instrucciones de alta calidad.
  3. Mezcla de azulejos de codificadores de visión (movimiento)
    • El modelo se integra Siglip y Convnext Como codificadores de visión dual, mejorando la comprensión de la imagen.
    • El mosaico de alta resolución asegura que los detalles de grano fino se conserven de manera eficiente.
    • Un método de mochila codiciosa consciente del equilibrio optimiza el embalaje de datos, reduciendo los costos de capacitación al tiempo que mejora la eficiencia de la muestra.

Estos elementos hacen que Eagle 2 sea poderoso y adaptable para diversas aplicaciones.

Rendimiento y conocimientos de referencia

Las capacidades de Eagle 2 se han probado rigurosamente, lo que demuestra un rendimiento fuerte en múltiples puntos de referencia:

  • Eagle2-9b logra 92.6% de precisión en DOCVQAsuperando a Internvl2-8b (91.6%) y GPT-4V (88.4%).
  • En BancarroEagle 2 puntajes 868superando a QWEN2-VL-7B (845) y MinicPM-V-2.6 (852), destacando sus fortalezas en el reconocimiento de texto.
  • Rendimiento de Mathvista Mejora por Over 10 puntos En comparación con su línea de base, reforzando la efectividad del enfoque de entrenamiento de tres etapas.
  • Tareas de razonamiento CHArTQA, OCR y razonamiento multimodal Muestre mejoras notables, superando a GPT-4V en áreas clave.

Además, el proceso de capacitación está diseñado para la eficiencia. Técnicas de selección de subconjuntos avanzados Tamaño del conjunto de datos reducido de Muestras de 12.7m a 4.6mMantener la precisión mientras mejora la eficiencia de los datos.

Conclusión

Eagle 2 representa un paso adelante para hacer que los VLM de alto rendimiento sean más accesibles y reproducibles. Enfatizando un enfoque transparente centrado en los datoscierra la brecha entre la accesibilidad de código abierto y el rendimiento de los modelos propietarios. Las innovaciones del modelo en Estrategia de datos, métodos de capacitación y arquitectura de visión Conviértalo en una opción convincente para investigadores y desarrolladores.

Al compartir abiertamente su metodología, Nvidia Ai fomenta un entorno de investigación de IA colaborativapermitiendo que la comunidad se base en estas ideas sin depender de modelos de código cerrado. A medida que AI continúa evolucionando, Eagle 2 ejemplifica cómo las estrategias de curación y capacitación de datos reflexivas pueden conducir a modelos robustos y de alto rendimiento en idioma de visión.


Verificar el Papel, Página de Github y Modelos en la cara abrazada. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos Gorjeo y únete a nuestro Canal de telegrama y LinkedIn GRsalpicar. No olvides unirte a nuestro 70k+ ml de subreddit.

🚨 Conocer Intellagent: Un marco de múltiples agentes de código abierto para evaluar un sistema de IA conversacional complejo (Promocionado)


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.