IBM lanza Granite 4.0 3B Vision: un nuevo modelo de lenguaje Vision para la extracción de datos de documentos de nivel empresarial

IBM ha anunciado el lanzamiento de Granite 4.0 3B Vision, un modelo de lenguaje de visión (VLM) diseñado específicamente para la extracción de datos de documentos de nivel empresarial. Partiendo del enfoque monolítico de modelos multimodales más grandes, la versión 4.0 Vision está diseñada como un adaptador especializado diseñado para brindar razonamiento visual de alta fidelidad a la columna vertebral del lenguaje Granite 4.0 Micro.

Esta versión representa una transición hacia una IA modular y centrada en la extracción que prioriza la precisión de los datos estructurados (como la conversión de gráficos complejos en código o tablas en HTML) sobre los subtítulos de imágenes de uso general.

Arquitectura: LoRA modular y integración DeepStack

El modelo Granite 4.0 3B Vision se entrega como un adaptador LoRA (adaptación de rango bajo) con aproximadamente 0,5 B de parámetros. Este adaptador está diseñado para cargarse sobre el modelo base Granite 4.0 Micro, un modelo de lenguaje denso de parámetros de 3.5B. Este diseño permite una implementación de ‘modo dual’: el modelo base puede manejar solicitudes de solo texto de forma independiente, mientras que el adaptador de visión se activa solo cuando se requiere procesamiento multimodal.

Codificador de visión y mosaico de parches

El componente visual utiliza el codificador google/siglip2-so400m-patch16-384. Para mantener una alta resolución en diversos diseños de documentos, el modelo emplea un mecanismo de ordenamiento en mosaico. Las imágenes de entrada se descomponen en parches de 384×384, que se procesan junto con una vista global reducida de toda la imagen. Este enfoque garantiza que los detalles finos, como subíndices en fórmulas o pequeños puntos de datos en gráficos, se conserven antes de que lleguen a la columna vertebral del lenguaje.

La columna vertebral de DeepStack

Para unir las modalidades de visión y lenguaje, IBM utiliza una variante de la arquitectura DeepStack. Esto implica apilar profundamente tokens visuales en el modelo de lenguaje en 8 puntos de inyección específicos. Al enrutar características visuales a múltiples capas del transformador, el modelo logra una alineación más estrecha entre el “qué” (contenido semántico) y el “dónde” (diseño espacial), lo cual es fundamental para mantener la estructura durante el análisis del documento.

Plan de estudios de formación: centrado en la extracción de gráficos y tablas

La formación de Granite 4.0 3B Vision refleja un giro estratégico hacia tareas de extracción especializadas. En lugar de depender únicamente de conjuntos de datos generales de imágenes y texto, IBM utilizó una combinación seleccionada de datos de seguimiento de instrucciones centrados en estructuras de documentos complejas.

Conjunto de datos ChartNet: el modelo se perfeccionó utilizando ChartNet, un conjunto de datos multimodal a escala de un millón diseñado para una comprensión sólida de los gráficos. Canalización guiada por código: un aspecto técnico clave de la capacitación implica un enfoque “guiado por código” para el razonamiento de gráficos. Esta canalización utiliza datos alineados que consisten en el código de trazado original, la imagen renderizada resultante y la tabla de datos subyacente, lo que permite que el modelo aprenda la relación estructural entre las representaciones visuales y sus datos de origen. Ajuste de extracción: el modelo se ajustó en una combinación de conjuntos de datos que se centran en la extracción de pares clave-valor (KVP), el reconocimiento de estructuras de tablas y la conversión de gráficos visuales a formatos legibles por máquina como CSV, JSON y OTSL.

Puntos de referencia de desempeño y evaluación

En evaluaciones técnicas, Granite 4.0 3B Vision se ha comparado con varias suites estándar de la industria para la comprensión de documentos. Es importante tener en cuenta que conjuntos de datos como PubTables-v2 y OmniDocBench se utilizan como puntos de referencia de evaluación para verificar el rendimiento cero del modelo en escenarios del mundo real.

TareaEvaluación comparativaMétricaExtracción de KVPVAREX85.5% Coincidencia exacta (Zero-Shot)Razonamiento de gráficosChartNet (conjunto de pruebas verificadas por humanos)Alta precisión en Chart2Extracción de tablas de resumenTablaVQA-Bench y OmniDocBenchEvaluado mediante extracción TEDS y HTML

Actualmente, el modelo ocupa el tercer lugar entre los modelos de la clase de parámetros 2 a 4B en la clasificación VAREX (a marzo de 2026), lo que demuestra su eficiencia en la extracción estructurada a pesar de su tamaño compacto.

https://huggingface.co/blog/ibm-granite/granite-4-vision
https://huggingface.co/blog/ibm-granite/granite-4-vision

Conclusiones clave

Arquitectura modular LoRA: el modelo es un adaptador LoRA de parámetro 0.5B que opera en la red troncal Granite 4.0 Micro (3.5B). Este diseño permite que una única implementación maneje cargas de trabajo de solo texto de manera eficiente y al mismo tiempo active las capacidades de visión solo cuando sea necesario. Mosaico de alta resolución: utilizando el codificador google/siglip2-so400m-patch16-384, el modelo procesa imágenes organizándolas en parches de 384×384 junto con una vista global reducida, lo que garantiza que se conserven los detalles finos en documentos complejos. Inyección DeepStack: para mejorar el conocimiento del diseño, el modelo utiliza un enfoque DeepStack con 8 puntos de inyección. Esto dirige las características semánticas a capas anteriores y los detalles espaciales a capas posteriores, lo cual es fundamental para una extracción precisa de tablas y gráficos. Entrenamiento de extracción especializado: más allá de seguir las instrucciones generales, el modelo se perfeccionó utilizando ChartNet y una canalización ‘guiada por código’ que alinea el código de trazado, las imágenes y las tablas de datos para ayudar al modelo a internalizar la lógica de las estructuras de datos visuales. Integración lista para desarrolladores: la versión tiene licencia Apache 2.0 y presenta soporte nativo para vLLM (a través de una implementación de modelo personalizado) y Docling, la herramienta de IBM para convertir archivos PDF no estructurados en JSON o HTML legibles por máquina.

Consulta los detalles técnicos y el peso del modelo. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.