Zhipu AI presenta GLM-OCR: un modelo de OCR multimodal 0.9B para análisis de documentos y extracción de información clave (KIE)

¿Por qué el OCR de documentos sigue siendo un difícil problema de ingeniería? ¿Qué se necesita para que el OCR sea útil para documentos reales en lugar de imágenes de demostración limpias? ¿Y puede un modelo multimodal compacto manejar análisis, tablas, fórmulas y extracción estructurada sin convertir la inferencia en una hoguera de recursos?

Ese es el problema al que se enfrenta el GLM-OCR, presentado por investigadores de Zhipu AI y la Universidad de Tsinghua. El equipo de investigación presenta GLM-OCR como un modelo multimodal compacto de parámetros 0,9B para la comprensión de documentos. Combina un codificador visual CogViT de 0,4B, un conector intermodal ligero y un decodificador de lenguaje GLM de 0,5B. El objetivo declarado es equilibrar la calidad del reconocimiento de documentos con una latencia más baja y un costo computacional más bajo que los sistemas multimodales más grandes.

Los sistemas tradicionales de OCR suelen ser buenos para la transcripción de texto sin formato, pero tienen dificultades cuando los documentos contienen diseños, tablas, fórmulas, bloques de código, sellos y campos estructurados mixtos. Los modelos recientes de lenguajes grandes multimodales mejoran la comprensión de los documentos, pero el equipo de investigación sostiene que su tamaño y su decodificación autorregresiva estándar los hacen costosos para la implementación perimetral y la producción a gran escala. GLM-OCR se posiciona como un sistema más pequeño creado para estas limitaciones de implementación en lugar de un modelo de visión y lenguaje de propósito general adaptado al OCR como una idea de último momento.

Una arquitectura compacta diseñada para cargas de trabajo de OCR

Un punto técnico clave para esta investigación es el uso de Predicción Multi-Token (MTP). La decodificación autorregresiva estándar predice un token a la vez, lo que no es ideal para tareas de estilo OCR donde los resultados suelen ser deterministas y estructurados localmente. En cambio, GLM-OCR predice múltiples tokens por paso. El modelo está entrenado para predecir 10 tokens por paso y genera 5,2 tokens por paso de decodificación en promedio en el momento de la inferencia, lo que produce una mejora del rendimiento de aproximadamente el 50 %. Para mantener manejable la sobrecarga de memoria, la implementación utiliza un esquema de intercambio de parámetros entre los modelos preliminares.

Análisis de diseño en dos etapas en lugar de lectura de página plana

A nivel de sistema, GLM-OCR adopta un proceso de dos etapas. La primera etapa utiliza PP-DocLayout-V3 para el análisis de diseño, que detecta regiones estructuradas en la página. La segunda etapa realiza un reconocimiento paralelo a nivel de región sobre las áreas detectadas. Esto es importante porque el modelo no se limita a leer una página completa de izquierda a derecha como lo haría un modelo genérico de visión y lenguaje. Primero divide la página en regiones semánticamente significativas, lo que mejora la eficiencia y hace que el sistema sea más sólido en documentos con diseños complicados.

El análisis de documentos y KIE utilizan diferentes rutas de salida

La arquitectura también separa dos tareas de documentos relacionadas. Para el análisis de documentos, la canalización utiliza detección de diseño y procesamiento de regiones para producir resultados estructurados como Markdown y JSON. Para la extracción de información clave (KIE), el equipo de investigación describe una ruta diferente: la imagen completa del documento se envía al modelo con un mensaje de tarea y el modelo genera directamente JSON que contiene los campos extraídos. Esa distinción es importante porque GLM-OCR no se presenta como un modelo monolítico único de página a texto. Es un sistema de generación estructurado con diferentes modos de funcionamiento según la tarea.

Un programa de capacitación de cuatro etapas con recompensas por tareas específicas

La receta de entrenamiento se divide en 4 etapas. La etapa 1 entrena al codificador de visión en pares de imagen y texto y datos de conexión a tierra o de recuperación. La etapa 2.1 realiza un entrenamiento previo multimodal en imagen-texto, análisis de documentos, conexión a tierra y datos VQA. La etapa 2.2 agrega el objetivo MTP. La etapa 3 consiste en el ajuste supervisado de tareas específicas de OCR, incluido el reconocimiento de texto, la transcripción de fórmulas, la recuperación de la estructura de tablas y KIE. La etapa 4 aplica el aprendizaje por refuerzo utilizando GRPO. El diseño de recompensa es específico de la tarea: distancia de edición normalizada para el reconocimiento de texto, puntuación CDM para el reconocimiento de fórmulas, puntuación TEDS para el reconocimiento de tablas y F1 a nivel de campo para KIE, junto con penalizaciones estructurales como penalizaciones por repetición, penalizaciones por estructura mal formada y restricciones de validación JSON.

Los resultados de referencia muestran un desempeño sólido, con salvedades importantes

En cuanto a los puntos de referencia públicos, GLM-OCR informa resultados sólidos en varias tareas de documentos. Obtiene una puntuación de 94,6 en OmniDocBench v1.5, 94,0 en OCRBench (texto), 96,5 en UniMERNet, 85,2 en PubTabNet y 86,0 en TEDS_TEST. Para KIE, informa 93,7 en Nanonets-KIE y 86,1 en Handwriting-KIE. El equipo de investigación señala que los resultados de Gemini-3-Pro y GPT-5.2-2025-12-11 se muestran solo como referencia y están excluidos de la clasificación de mejor puntuación, lo cual es un detalle importante al interpretar las afirmaciones sobre el liderazgo del modelo.

https://arxiv.org/pdf/2603.10910

La historia del punto de referencia es contundente, pero necesita una redacción cuidadosa. GLM-OCR logra las puntuaciones más altas entre los modelos no de referencia evaluados en OmniDocBench v1.5, OCRBench (Texto), UniMERNet y TEDS_TEST. En PubTabNet, sin embargo, no lidera en general; MinerU 2.5 reporta 88,4 frente a 85,2 de GLM-OCR. Para KIE, GLM-OCR supera a los competidores de código abierto enumerados en la tabla anterior, pero Gemini-3-Pro obtiene puntuaciones más altas tanto en Nanonets-KIE como en Handwriting-KIE en la columna de referencia. Por lo tanto, el equipo de investigación apoya una afirmación competitiva fuerte, pero no una afirmación general de “mejor en todo”.

Detalles de implementación

El equipo de investigación afirma que GLM-OCR es compatible con vLLM, SGLang y Ollama, y ​​se puede ajustar a través de LLaMA-Factory. También informan un rendimiento de 0,67 imágenes/s y 1,86 páginas PDF/s en su configuración de evaluación. Además, describen una API MaaS con un precio de 0,2 RMB por millón de tokens, con ejemplos de estimaciones de costos para imágenes escaneadas y archivos PDF de diseño simple. Estos detalles sugieren que GLM-OCR se está enmarcando como un modelo de investigación y un sistema desplegable.

Conclusiones clave

GLM-OCR es un modelo OCR multimodal compacto de 0,9B construido con un codificador CogViT de 0,4B y un decodificador GLM de 0,5B. Utiliza predicción de múltiples tokens (MTP) para mejorar la eficiencia de decodificación, alcanzando un promedio de 5,2 tokens por paso y un rendimiento aproximadamente un 50 % mayor. El modelo utiliza una canalización de dos etapas: PP-DocLayout-V3 maneja el análisis de diseño, luego GLM-OCR realiza un reconocimiento paralelo a nivel de región. Admite tanto el análisis de documentos como KIE: el análisis genera Markdown/JSON, mientras que KIE genera directamente JSON a partir de la imagen completa del documento. Los resultados de las pruebas comparativas son sólidos, pero no victorias universales: GLM-OCR lidera varias pruebas comparativas sin referencia, pero MinerU 2.5 es superior en PubTabNet y Gemini-3-Pro es superior en las puntuaciones KIE de solo referencia.

Consulte la página de papel, repositorio y modelo. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.