El equipo PaddlePaddle de Baidu lanza PaddleOCR-VL (0.9B): un VLM estilo NaViT + ERNIE-4.5-0.3B dirigido al análisis de documentos multilingües de un extremo a otro

¿Cómo se pueden convertir documentos complejos y multilingües (diseños densos, guiones pequeños, fórmulas, gráficos y escritura a mano) en Markdown/JSON estructurado fiel con precisión de última generación y al mismo tiempo mantener la latencia de inferencia y la memoria lo suficientemente bajas para implementaciones reales? El grupo PaddlePaddle de Baidu ha lanzado PaddleOCR-VL, un modelo de lenguaje de visión de 0.9B de parámetros diseñado para el análisis de documentos de un extremo a otro en texto. tablas, fórmulas, gráficos y escritura a mano. El modelo principal combina un codificador de visión de resolución dinámica estilo NaViT (ViT de resolución nativa) con el decodificador ERNIE-4.5-0.3B. Admite 109 idiomas.

https://ernie.baidu.com/blog/publication/PaddleOCR-VL_Technical_Report.pdf

Comprender el diseño del sistema

PaddleOCR-VL se implementa como un proceso de dos etapas. La primera etapa (PP-DocLayoutV2) realiza un análisis de diseño a nivel de página: un detector RT-DETR localiza y clasifica regiones; una red de punteros predice el orden de lectura. La segunda etapa (PaddleOCR-VL-0.9B) realiza un reconocimiento a nivel de elemento condicionado al diseño detectado. Los resultados finales se agregan a Markdown y JSON para el consumo posterior. Este desacoplamiento mitiga la inestabilidad y la latencia de decodificación de secuencia larga que enfrentan los VLM de extremo a extremo en páginas densas, de varias columnas y con mezcla de texto y gráficos.

A nivel de modelo, PaddleOCR-VL-0.9B integra un codificador dinámico de alta resolución estilo NaViT (empaquetado de secuencia de resolución nativa) con un proyector MLP de 2 capas y el modelo de lenguaje ERNIE-4.5-0.3B; 3D-RoPE se utiliza para la representación posicional. El informe técnico atribuye menos alucinaciones y un mejor rendimiento del texto denso al procesamiento de resolución nativa en comparación con los enfoques de cambio de tamaño fijo o mosaico. La idea de NaViT (parchear y empaquetar entradas de resolución variable sin cambio de tamaño destructivo) se origina en trabajos anteriores que muestran una mayor eficiencia y solidez; PaddleOCR-VL adopta este estilo de codificador directamente.

Puntos de referencia

PaddleOCR-VL logra resultados de última generación en OmniDocBench v1.5 y puntuaciones competitivas o líderes en v1.0, cubriendo la calidad general, así como las subtareas (distancias de edición de texto, Formula-CDM, Table-TEDS/TEDS-S y edición de orden de lectura), con fortaleza complementaria en olmOCR-Bench y evaluaciones internas de escritura a mano, tablas, fórmulas y gráficos.

https://ernie.baidu.com/blog/publication/PaddleOCR-VL_Technical_Report.pdf

Conclusiones clave

PaddleOCR-VL de parámetro 0.9B integra un codificador de resolución dinámica estilo NaViT con ERNIE-4.5-0.3B para el análisis de documentos. Se dirige a la extracción de un extremo a otro de texto, tablas, fórmulas, gráficos y escritura a mano con salidas estructuradas de Markdown/JSON. Afirma el rendimiento de SOTA en pruebas comparativas de documentos públicos con inferencia rápida adecuada para la implementación. Admite 109 idiomas, incluidos scripts pequeños y diseños de página complejos.

Esta versión es significativa porque combina un codificador visual de resolución dinámica estilo NaViT con el decodificador liviano ERNIE-4.5-0.3B para brindar análisis de documentos SOTA a nivel de página y reconocimiento a nivel de elementos a un costo de inferencia práctico. El diseño de dos etapas PP-DocLayoutV2 → PaddleOCR-VL-0.9B estabiliza el orden de lectura y preserva las claves tipográficas nativas, que son importantes para pequeños guiones, fórmulas, gráficos y escritura a mano en 109 idiomas. Las salidas estructuradas de Markdown/JSON y la aceleración vLLM/SGLang opcional hacen que el sistema sea operativamente limpio para la inteligencia de documentos de producción.

Consulte el documento técnico, el modelo sobre HF y los detalles técnicos. No dude en consultar nuestra página de GitHub para tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como empresario e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.

🙌 Siga MARKTECHPOST: agréguenos como fuente preferida en Google.