GLM-4.1V-pensamiento: avance de comprensión multimodal y razonamiento de uso general

Los modelos en idioma de visión (VLMS) juegan un papel crucial en los sistemas inteligentes actuales al permitir una comprensión detallada del contenido visual. La complejidad de las tareas de inteligencia multimodal ha crecido, desde la resolución científica de problemas hasta el desarrollo de agentes autónomos. Las demandas actuales en VLMS han superado con creces la percepción simple del contenido visual, con una atención creciente en el razonamiento avanzado. Si bien los trabajos recientes muestran que el razonamiento de forma larga y la RL escalable mejoran significativamente las habilidades de resolución de problemas de LLMS, los esfuerzos actuales se centran principalmente en dominios específicos para mejorar el razonamiento de VLM. La comunidad de código abierto actualmente carece de un modelo de razonamiento multimodal que supera a los modelos tradicionales no pensativos de escala de parámetros comparables en diversas tareas.

Investigadores de la Universidad Zhipu AI y Tsinghua han propuesto el pensamiento GLM-4.1V, un VLM diseñado para avanzar en la comprensión y el razonamiento multimodal de uso general. Luego, el enfoque introduce el aprendizaje de refuerzo con el muestreo curricular (RLC) para desbloquear el potencial total del modelo, permitiendo mejoras en la resolución de problemas STEM, la comprensión de videos, el reconocimiento de contenido, la codificación, la base, los agentes basados en GUI y la larga comprensión de los documentos. Investigadores de pensamiento GLM-4.1V-9B de origen abierto, que establece un nuevo punto de referencia entre modelos de tamaño similar. También ofrece un rendimiento competitivo, y en algunos casos superior en comparación con modelos patentados como GPT-4O en tareas desafiantes, como la comprensión de documentos largos y el razonamiento STEM.

El pensamiento GLM-4.1V contiene tres componentes centrales: un codificador de visión, un adaptador MLP y un decodificador LLM. Utiliza AIMV2-huge como el codificador de visión y GLM como el LLM, reemplazando las convoluciones 2D originales con convoluciones 3D para la reducción de la reducción temporal. El modelo integra la cuerda 2D para admitir resoluciones de imagen arbitrarias y relaciones de aspecto, y procesa relaciones de aspecto extremas en 200: 1 y altas resoluciones más allá de 4K. Los investigadores extienden la cuerda a la cuerda 3D en la LLM para mejorar la comprensión espacial en contextos multimodales. Para el modelado temporal en videos, se agregan tokens de índice de tiempo después de cada token de cuadro, con marcas de tiempo codificadas como cadenas para ayudar al modelo a comprender las brechas temporales del mundo real entre los marcos

Durante la capacitación previa, los investigadores usan una variedad de conjuntos de datos, combinando grandes corpuses académicos con datos de texto de imagen entrelazados ricos en conocimiento. Al incluir datos de texto puro, se conservan las capacidades de lenguaje central del modelo, lo que resulta en un mejor rendimiento de pase@k que otros modelos base previamente capacitados de última generación de tamaño similar. La etapa supervisada de ajuste fino transforma el VLM base en una capaz de una inferencia de cuna larga utilizando un corpus de cot larga curado a través de los problemas verificables, como los problemas STEM y las tareas no verificables, como la instrucción siguiente. Finalmente, la fase RL emplea una combinación de RLVR y RLHF para llevar a cabo capacitación a gran escala en todos los dominios multimodales, incluida la resolución de problemas STEM, la base, el reconocimiento de carácter óptico, los agentes de la GUI y muchos más.

GLM-4.1V-9B-pensamiento supera a todos los modelos de código abierto competidores bajo parámetros de 10B en tareas generales de VQA que cubren la configuración de imágenes individuales y de imágenes múltiples. Logra el más alto rendimiento en puntos de referencia STEM desafiantes, incluidos MMMU_VAL, MMMU_PRO, VideOmmMu y AI2D. En los dominios OCR y CART, el modelo establece nuevos puntajes de última generación en Chartqapro y Chartmuseum. Para una larga comprensión de documentos, el pensamiento GLM-4.1V-9B supera a todos los demás modelos en MMLongbench, al tiempo que establece nuevos resultados de vanguardia en agentes de GUI y tareas de codificación multimodal. Por último, el modelo muestra el rendimiento robusto de comprensión de video, superando los puntos de referencia de VideoMme, MMVU y MotionBench.

En conclusión, los investigadores introdujeron el pensamiento GLM-4.1V, lo que representa un paso hacia el razonamiento multimodal de uso general. Su modelo de parámetro 9B supera a modelos más grandes como el que excede los parámetros de 70b. Sin embargo, quedan varias limitaciones, como mejoras inconsistentes en la calidad del razonamiento a través de RL, inestabilidad durante el entrenamiento y dificultades con casos complejos. Los desarrollos futuros deben centrarse en mejorar la supervisión y la evaluación del razonamiento del modelo, con modelos de recompensa que evalúan los pasos de razonamiento intermedio mientras detectan alucinaciones e inconsistencias lógicas. Además, explorar estrategias para prevenir la piratería de recompensas en tareas de evaluación subjetiva es crucial para lograr la inteligencia de uso general.


Mira el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto.

Oportunidad de patrocinio
Llegar a los desarrolladores de IA más influyentes en todo el mundo. 1M+ lectores mensuales, 500k+ constructores comunitarios, infinitas posibilidades. [Explore Sponsorship]


Sajjad Ansari es un pregrado de último año de IIT Kharagpur. Como entusiasta de la tecnología, profundiza en las aplicaciones prácticas de la IA con un enfoque en comprender el impacto de las tecnologías de IA y sus implicaciones del mundo real. Su objetivo es articular conceptos complejos de IA de manera clara y accesible.