El razonamiento matemático multimodal permite a las máquinas resolver problemas que involucran información textual y componentes visuales como diagramas y figuras. Esto requiere combinar la comprensión del lenguaje y la interpretación visual para dar sentido a los contextos matemáticos complejos. Dichas capacidades son vitales en educación, tutoría automatizada y análisis de documentos, donde los problemas a menudo se presentan una combinación de texto e imágenes.
Un obstáculo importante en esta área es la falta de alineación precisa y de alta calidad entre las imágenes matemáticas y sus representaciones textuales o simbólicas. La mayoría de los conjuntos de datos utilizados para entrenar modelos multimodales grandes se derivan de los subtítulos de imagen en entornos naturales, que a menudo pierden los elementos detallados esenciales para la precisión matemática. Esto crea problemas para los modelos que dependen de estas fuentes de datos, haciéndolos poco confiables cuando se trata de geometría, cifras o diagramas técnicos. El rendimiento de un modelo en el razonamiento matemático depende en gran medida de su capacidad para interpretar y vincular correctamente estos detalles visuales con expresiones o instrucciones matemáticas.
En el pasado, algunos enfoques intentaron abordar esto mejorando los codificadores visuales o utilizando conjuntos de datos elaborados manualmente. Sin embargo, estos métodos tienden a producir una baja diversidad de imágenes, dependiendo de la generación codificada a mano o basada en plantillas, lo que limita su aplicabilidad. Algunos esfuerzos, como Math-Llava y Mavis, desarrollaron conjuntos de datos sintéticos y plantillas usadas o categorías predefinidas. Aún así, no pudieron crear dinámicamente una amplia variedad de imágenes relacionadas con las matemáticas. Este déficit restringe el alcance de aprendizaje de los modelos y los deja luchando con problemas matemáticos más complejos o menos estructurados.
Investigadores del laboratorio multimedia de la Universidad China de Hong Kong y CPII bajo Innohk introdujeron un enfoque novedoso llamado Mathcoder-VL. Este método combina un modelo de visión a código llamado FigCodifier y un motor de datos sintético. Construyeron el conjunto de datos IMGCODE-8.6M utilizando una estrategia de modelo en el bucle, que les permitió construir el conjunto de datos de código de imagen más grande hasta la fecha. Además, desarrollaron MM-MathInstruct-3M, un conjunto de datos de instrucciones multimodales enriquecido con imágenes recientemente sintetizadas. El modelo MathCoder-VL está entrenado en dos etapas: entrenamiento medio en IMGCODE-8.6M para mejorar la alineación del texto visual y el ajuste fino en MM-MATHINSTRUCT-3M para fortalecer las habilidades de razonamiento.
El modelo FIGCodifier funciona traduciendo figuras matemáticas en código que pueden recrear esas cifras exactamente. Este emparejamiento de imagen de código garantiza una alineación y precisión estrictas, a diferencia de los conjuntos de datos basados en subtítulos. El proceso comienza con 119k pares de código de imagen de DATIKZ y se expande a través de la capacitación iterativa utilizando imágenes recopiladas de libros de texto, conjuntos de datos K12 y documentos ARXIV. El conjunto de datos final incluye 8.6 millones de pares de imágenes de código y cubre varios temas matemáticos. FigCodifier también admite la renderización basada en Python, que agrega variedad a la generación de imágenes. El sistema filtra los datos de baja calidad verificando la validez del código y eliminando imágenes redundantes o inútiles, lo que resulta en 4,3 millones de pares de alta calidad y pares a base de Python de 4.3M.
Las evaluaciones de rendimiento muestran que MathCoder-VL supera a múltiples modelos de código abierto. La versión 8B alcanzó el 73.6% de precisión en el subconjunto de resolución de problemas de geometría de Mathvista, superando el soneto GPT-4O y Claude 3.5 en 8.9% y 9.2%, respectivamente. También obtuvo un 26.1% en visión matemática y 46.5% en Mathverse. En los puntos de referencia en idioma chino, logró un 51.2% en Gaokao-MM. En el punto de referencia We-Math, resolvió problemas de dos pasos con 58.6%, superando el 58.1%de GPT-4O. Su rendimiento en problemas de tres pasos alcanzó el 52.1%, nuevamente superando el 43.6%de GPT-4O. En comparación con su modelo base Internvl2-8b, mostraron ganancias de 6.1% en visión matemática y 11.6% en Mathvista.
Este trabajo define claramente el problema de la alineación visual-textual insuficiente en el razonamiento matemático multimodal y proporciona una solución escalable e innovadora. La introducción de FigCodifier y los conjuntos de datos sintéticos permite a los modelos aprender de imágenes precisas y diversas emparejadas con un código exacto, lo que aumenta significativamente sus habilidades de razonamiento. Mathcoder-VL representa un avance práctico en este campo, lo que demuestra cómo el diseño del modelo reflexivo y los datos de alta calidad pueden superar las limitaciones de larga data en la IA matemática.
Mira el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 95k+ ml de subreddit y suscribirse a Nuestro boletín.
Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.