Tencent Hunyuan lanza HunyuanOCR: un VLM experto en OCR de extremo a extremo con mil millones de parámetros

Tencent Hunyuan ha lanzado HunyuanOCR, un modelo de lenguaje de visión de parámetros 1B especializado en OCR y comprensión de documentos. El modelo se basa en la arquitectura multimodal nativa de Hunyuan y ejecuta la detección, el análisis, la extracción de información, la respuesta visual a preguntas y la traducción de imágenes de texto a través de un único proceso de extremo a extremo.

HunyuanOCR es una alternativa ligera a los VLM generales como Gemini 2.5 y Qwen3 VL que aún los iguala o los supera en tareas centradas en OCR. Se dirige a casos de uso de producción como análisis de documentos, extracción de tarjetas y recibos, extracción de subtítulos de vídeo y traducción de documentos multilingües.

https://github.com/Tencent-Hunyuan/HunyuanOCR/blob/main/HunyuanOCR_Technical_Report.pdf

Arquitectura, resolución nativa ViT más LLM ligero

HunyuanOCR utiliza 3 módulos principales, un codificador visual de resolución nativa llamado Hunyuan ViT, un conector MLP adaptable y un modelo de lenguaje ligero. El codificador se basa en SigLIP-v2-400M y se ha ampliado para admitir resoluciones de entrada arbitrarias mediante parches adaptativos que conservan la relación de aspecto original. Las imágenes se dividen en parches según sus proporciones nativas y se procesan con atención global, lo que mejora el reconocimiento de líneas de texto largas, documentos largos y escaneos de baja calidad.

El conector MLP adaptable realiza una agrupación que se puede aprender en la dimensión espacial. Comprime los tokens visuales densos en una secuencia más corta, mientras mantiene la información de las regiones densas de texto. Esto reduce la longitud de la secuencia pasada al modelo de lenguaje y reduce el cálculo, al tiempo que conserva los detalles relevantes del OCR.

El modelo de lenguaje se basa en el modelo Hunyuan 0.5B de arquitectura densa y utiliza XD RoPE. XD RoPE divide las incrustaciones de posición giratoria en 4 subespacios para texto, alto, ancho y tiempo. Esto le da al modelo una forma nativa de alinear el orden de los tokens 1D con el diseño 2D y la estructura espaciotemporal 3D. Como resultado, la misma pila puede manejar páginas de varias columnas, flujos de páginas cruzadas y secuencias de fotogramas de vídeo.

El entrenamiento y la inferencia siguen un paradigma completamente de principio a fin. No hay ningún análisis de diseño externo ni modelo de posprocesamiento en el bucle. Todas las tareas se expresan como indicaciones en lenguaje natural y se manejan en un solo paso hacia adelante. Este diseño elimina la propagación de errores entre las etapas del proceso y simplifica la implementación.

Receta de datos y preentrenamiento

La canalización de datos crea más de 200 millones de pares de imágenes y texto, en 9 escenarios del mundo real, que incluyen vistas de calles, documentos, anuncios, texto escrito a mano, capturas de pantalla, tarjetas, certificados y facturas, interfaces de juegos, fotogramas de vídeo y tipografía artística. El corpus cubre más de 130 idiomas.

Los datos sintéticos provienen de un generador multilingüe que admite escrituras de derecha a izquierda y representación a nivel de párrafo. La canalización controla la fuente, el idioma, la rotación y los valores RGB, y aplica cambios de deformación, desenfoque y iluminación local para simular capturas móviles y otras condiciones difíciles.

https://github.com/Tencent-Hunyuan/HunyuanOCR/blob/main/HunyuanOCR_Technical_Report.pdf

El preentrenamiento sigue 4 etapas. La etapa 1 realiza la alineación del lenguaje de visión con texto puro, datos de reconocimiento y análisis sintéticos y datos de subtítulos generales, utilizando tokens de 50 mil millones y contexto de 8k. La etapa 2 ejecuta un entrenamiento previo multimodal en tokens 300B que combinan texto puro con detección sintética, análisis, traducción y muestras VQA. La etapa 3 extiende la longitud del contexto a 32k con 80 mil millones de tokens enfocados en documentos y textos largos. La etapa 4 es un ajuste fino supervisado orientado a la aplicación en 24 mil millones de tokens de datos negativos duros y anotados por humanos, manteniendo un contexto de 32 mil y plantillas de instrucciones unificadas.

Aprendizaje por refuerzo con recompensas verificables

Después del entrenamiento supervisado, HunyuanOCR se optimiza aún más con el aprendizaje por refuerzo. El equipo de investigación utiliza GRPO de optimización de políticas relativas al grupo y una configuración de aprendizaje por refuerzo con recompensas verificables para tareas estructuradas. Para la detección de texto, la recompensa se basa en la intersección sobre la unión de cuadros combinada con la distancia de edición normalizada sobre el texto. Para el análisis de documentos, la recompensa utiliza una distancia de edición normalizada entre la estructura generada y la referencia.

Para VQA y traducción, el sistema utiliza un LLM como juez. VQA utiliza una recompensa binaria que comprueba la coincidencia semántica. La traducción utiliza un LLM de puntuación de estilo COMET con puntuaciones en [0, 5]normalizado a [0, 1]. El marco de capacitación impone límites de longitud y formatos estrictos, y asigna recompensa cero cuando los resultados se desbordan o rompen el esquema, lo que estabiliza la optimización y fomenta resultados estructurados o JSON válidos.

Resultados de referencia: un modelo 1B que compite con VLM más grandes

En el punto de referencia interno de detección de texto de 900 imágenes en 9 categorías, HunyuanOCR alcanza una puntuación general de 70,92. Supera a los métodos tradicionales de canalización como PaddleOCR y BaiduOCR y también a los VLM generales como Gemini 2.5 Pro, Qwen3 VL 2B, Qwen3 VL 235B y Seed 1.6 Vision, a pesar de utilizar muchos menos parámetros.

En OmniDocBench, HunyuanOCR logra 94,10 en general, con 94,73 en fórmulas y 91,81 en tablas. En la variante Wild OmniDocBench, que imprime y recaptura documentos bajo pliegues y cambios de iluminación, obtiene una puntuación general de 85,21. En DocML, un punto de referencia de análisis multilingüe en 14 idiomas distintos del chino y del inglés, alcanza 91,03 y el documento informa resultados de última generación en los 14 idiomas.

Para extracción de información y VQA, HunyuanOCR alcanza una precisión de 92,29 en tarjetas, 92,53 en recibos y 92,87 en subtítulos de vídeo. En OCRBench, obtiene una puntuación de 860, más alta que DeepSeek OCR a escala similar y cercana a VLM generales más grandes como Qwen3 VL 2B Instruct y Gemini 2.5 Pro.

En la traducción de imágenes de texto, HunyuanOCR utiliza el punto de referencia DoTA y un conjunto interno basado en DocML. Logra una sólida puntuación COMET en DoTA para la traducción de documentos del inglés al chino, y el modelo gana el primer lugar en el modelo pequeño sin OCR Track 2.2 de la competencia DIMT ICDAR 2025.

https://github.com/Tencent-Hunyuan/HunyuanOCR/blob/main/HunyuanOCR_Technical_Report.pdf

Conclusiones clave

OCR VLM compacto de extremo a extremo: HunyuanOCR es un modelo de lenguaje de visión enfocado en OCR de 1B de parámetros que conecta un ViT de resolución nativa de 0,4B a un modelo de lenguaje Hunyuan de 0,5B a través de un adaptador MLP y ejecuta detección, análisis, extracción de información, VQA y traducción en un canal impulsado por instrucciones de un extremo a otro sin diseño externo ni módulos de detección. Soporte unificado para diversos escenarios de OCR: el modelo está entrenado en más de 200 millones de pares de imágenes y texto en 9 escenarios, incluidos documentos, vistas de calles, anuncios, contenido escrito a mano, capturas de pantalla, tarjetas y facturas, interfaces de juegos y fotogramas de video, con una cobertura de más de 130 idiomas en entrenamiento y soporte para más de 100 idiomas en implementación. Canalización de datos más aprendizaje por refuerzo: la capacitación utiliza una receta de 4 etapas, alineación del lenguaje de visión, capacitación previa multimodal, capacitación previa de contexto prolongado y ajuste fino supervisado orientado a la aplicación, seguido de aprendizaje por refuerzo con optimización de políticas relativas al grupo y recompensas verificables por detección, análisis, VQA y traducción. Sólidos resultados de referencia para modelos sub 3B
HunyuanOCR alcanza 94,1 en OmniDocBench para la comprensión de documentos y alcanza 860 en OCRBench, que se considera de última generación entre los modelos de lenguaje de visión con menos de 3B de parámetros, al tiempo que supera a varias API de OCR comerciales y modelos abiertos más grandes como Qwen3 VL 4B en los puntos de referencia principales de OCR.

Notas editoriales

HunyuanOCR es una fuerte señal de que los VLM específicos de OCR están madurando hasta convertirse en una infraestructura práctica, no sólo en puntos de referencia. Tencent combina una arquitectura de extremo a extremo de parámetros 1B con Native Vision Transformer, Adaptive MLP Connector y RL con recompensas verificables para ofrecer un modelo único que cubre detección, análisis, IE, VQA y traducción en más de 100 idiomas, y lo hace mientras alcanza puntuaciones líderes en OCRBench para modelos sub 3B y 94.1 en OmniDocBench. En general, HunyuanOCR marca un cambio importante hacia motores OCR compactos impulsados ​​por instrucciones que son realistas para la implementación en producción.

Consulte el papel, el peso del modelo y el repositorio. No dude en consultar nuestra página de GitHub para tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como empresario e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.

🙌 Siga MARKTECHPOST: agréguenos como fuente preferida en Google.