Datalab ha lanzado Marker 2, una reescritura completa de su proceso de conversión de documentos de código abierto. Marker convierte archivos PDF, imágenes, PPTX, DOCX, XLSX, HTML y EPUB en rebajas, JSON, HTML o fragmentos. El equipo de Datalab lo reconstruyó en torno a tres componentes enviados durante los meses anteriores: Surya OCR 2, un modelo de diseño rápido de 20 M de parámetros y un texto pdf reconstruido que es 3 veces más rápido que el anterior.
El resultado principal proviene de olmOCR-bench, un punto de referencia externo de Allen AI. El modo equilibrado de Marker 2 obtiene una puntuación del 76,0 % en general y del 83,5 % en archivos PDF digitales. Soporta 2,9 páginas por segundo en una sola GPU B200. Eso es más de 5 veces el rendimiento del backend de la canalización de MinerU, que obtiene una puntuación del 72,7 % a 0,54 páginas por segundo. Docling obtiene una puntuación del 50,3% a 2,1 páginas por segundo con el mismo arnés.
Novedades del Marcador 2
El marcador 2 expone tres rutas de conversión en lugar de una:
equilibrado: Surya VLM maneja el diseño y toda la página se vuelve a realizar OCR siempre que el texto incrustado sea incorrecto. La más alta calidad, la mejor en GPU. 76,0% olmOCR-bench. Rápido: un detector de diseño ligero rf-detr/onnx más texto pdf, con un uso quirúrgico mínimo de VLM. 66,6%, y mucho más barato. –disable_ocr: extracción pura de capa de texto, sin llamadas VLM en absoluto. Se ejecuta completamente en la CPU. 43,6%, 23,7 páginas/s.
El modo ahora tiene en cuenta el dispositivo de forma predeterminada: equilibrado en GPU, rápido en CPU/MPS, anulable con –mode. El soporte total de CPU es el segundo cambio estructural. rápido –disable_ocr no necesita GPU ni servidor de inferencia, y el modelo de diseño de 20M aún lee columnas, tablas y encabezados en la CPU.
El tercer cambio es arquitectónico y es el que produce las cifras de rendimiento. Muchos trabajadores con CPU ligeras comparten un único servidor de inferencia Surya. El proceso principal presupuesta la simultaneidad de VLM entre ellos, por lo que el rendimiento aumenta con la capacidad del servidor en lugar de con la VRAM por proceso. Datalab informa que el modo equilibrado mantiene ~2,9 pg/s frente a una velocidad de flujo único de ~0,3 pg/s en el mismo hardware.
Vale la pena señalar los cambios importantes antes de una actualización. Ahora se requiere Python 3.10+. El empaque se movió de Poetry a uv, con hatchling como backend de compilación, aunque pip install Marker-pdf no ha cambiado. Se retiraron el convertidor de extracción estructurada y los extractores; Datalab dirige a los usuarios a la API alojada o a un flujo de trabajo –use_llm.
Comparación
El punto de referencia de puntuación es olmOCR-bench de Ai2: 1.403 archivos PDF con aproximadamente 8.400 pruebas unitarias de aprobación/reprobación que cubren representación matemática, estructura de tablas, orden de lectura, encabezados y pies de página, y escaneos antiguos. La puntuación general es el macropromedio de las 8 categorías, calculada con el verificador oficial de banco olmOCR. El rendimiento es pg/s concurrente sostenido en un host B200, no latencia de flujo único.
Una nota sobre la procedencia. olmOCR-bench es un punto de referencia de terceros de Ai2, pero cada puntuación y cifra de rendimiento a continuación proviene de las propias ejecuciones de Datalab. Todos ellos son reproducibles a través del arnés abierto en el repositorio de Marker, que envía corredores de la competencia para MinerU, Docling y LiteParse junto con los de Marker.
Estos números también reflejan la combinación de documentos de un punto de referencia medido en una única configuración de hardware, por lo que los resultados en sus propios documentos pueden diferir. Los equipos que evalúan estos sistemas deben compararlos con su propio corpus, que es la única manera de saber cómo se clasifican los cuatro en los documentos que realmente procesan.
Marcador 2 contra MinerU
El backend del pipeline de MinerU es la arquitectura más cercana. Ambos leen la capa de texto PDF y OCR de forma selectiva. En la puntuación general, Marker equilibró la ventaja entre 76,0 y 72,7. En los documentos nacidos en formato digital, los dos están efectivamente empatados: 83,5 frente a 83,3.
La separación es el rendimiento. El marcador equilibrado sostiene 2,9 pg/s frente a los 0,54 pg/s de MinerU, una brecha de 5,4 veces con una puntuación más alta. Marker Fast mantiene 7,4 pg/s, aproximadamente 13,7 veces la velocidad de producción de MinerU, pero obtiene una puntuación de 6,1 puntos por debajo de MinerU para lograrlo.
MinerU también incluye un backend VLM, que según Datalab tiene una puntuación más alta que su backend en proceso. Ese backend es un enfoque VLM de página completa y no está en esta tabla. Los equipos de IA que evalúan MinerU deberían comparar ese camino por separado.
Marcador 2 vs Docling
Docling es el margen más amplio entre los canales de GPU. El marcador equilibrado lidera 76,0 a 50,3 en general y 83,5 a 64,0 en nacido digital, mientras que también corre más rápido: 2,9 pg/s contra 2,1 pg/s. Datalab señala que Docling se ejecutó en su canal predeterminado, que utiliza la capa de texto para páginas digitales y OCR para regiones de imágenes.
El contrapeso de Docling es la gobernanza y la amplitud del formato, no la precisión. El código base tiene licencia del MIT, se originó en IBM Research y está alojado como un proyecto en LF AI & Data Foundation. Su lista de entrada también amplía documentos anteriores a formatos de audio y correo electrónico.
Marcador 2 y LiteParse
LiteParse, del equipo de LlamaIndex, es un analizador de documentos de Rust. No compite en el mismo eje. En CPU, obtiene una puntuación de 22,4 en general y 20,4 con OCR desactivado, frente al 43,6 de Marker solo en CPU.
Pero LiteParse con OCR deshabilitado reporta 1721 pg/s, aproximadamente 73 veces el modo de CPU de Marker, que es la compensación. El rápido –disable_ocr de Marker ejecuta un modelo de diseño de 20 M en la CPU y aún recupera la estructura, razón por la cual duplica con creces la puntuación de un volcado de texto sin formato. LiteParse no tiene modelo de diseño y colapsa sobre cualquier cosa no lineal.
Marcador 2 frente al nivel VLM de página completa
El equipo de Datalab enfatiza que Marker está diseñado como una canalización en lugar de un VLM, y aclara que se trata de herramientas distintas. En esta evaluación, su Chandra 2 alojado obtiene una puntuación de 85,8, mientras que Gemini Flash 3.5 a través de API obtiene una puntuación de 76,4. El repositorio Chandra de Datalab también posiciona olmOCR 2 de Ai2 en 82,4 y dots.ocr 1,5 en 83,9 dentro de una tabla separada. Para escaneos, páginas con muchas matemáticas y lograr la máxima precisión, el nivel VLM sigue siendo superior a todas las canalizaciones enumeradas.
El modo equilibrado de Marker reduce la brecha de rendimiento a sólo 0,4 puntos detrás de Gemini Flash 3.5 en general, e incluso lo supera en documentos digitales por un margen de 83,5 a 79,1, sin necesidad de una llamada API por página.
Comportamiento por categoría
El modo que elijas cambia el perfil de fallo, no sólo la puntuación. Cada fila es una categoría de banco olmOCR, puntuada en los tres modos. Las matemáticas son la vanguardia: el modo rápido lee ecuaciones de la capa de texto PDF en lugar de VLM-OCR, por lo que arXiv math cae de 83,9 a 23,4, y –disable_ocr obtiene una puntuación de 0,0 allí por diseño. Fuera de las dos categorías matemáticas, los escaneos antiguos son la división más débil en todos los modos, alcanzando un máximo de 43,2.
Licencias
Aquí es donde más divergen los cuatro sistemas para los equipos comerciales:
Marcador: el código es Apache 2.0. Los pesos de los modelos utilizan una licencia OpenRAIL-M de AI Pubs modificada: gratuita para investigación, uso personal y nuevas empresas con una financiación/ingresos de 5 millones de dólares. Más allá de eso, el uso comercial de las pesas requiere una licencia paga. MinerU: ahora bajo la Licencia MinerU Open Source, basada en Apache 2.0 con condiciones adicionales. Se requiere una licencia comercial independiente por encima de 100 millones de MAU o ingresos mensuales de 20 millones de dólares, y los servicios en línea basados en ella deben revelar ese hecho. Docling: MIT, con licencias de modelos rastreadas por separado en sus paquetes originales. LiteParse: código abierto, de run-llama, con LlamaParse posicionado como la ruta de nube paga para documentos impresos.
Caso de uso: comparación
La puntuación por sí sola no determina la herramienta. El tipo de corpus, el hardware, la banda de licencia y el formato de salida lo deciden. Pruebe el selector interactivo a continuación para filtrar diez escenarios de implementación por restricción y por herramienta, y vea qué analizador se adapta a su caso de uso.
Conclusiones clave
El marcador 2 obtuvo una puntuación equilibrada del 76,0 % en el banco olmOCR a 2,9 pg/s, más de 5 veces el rendimiento del oleoducto de MinerU. Supera a Docling en ambos ejes a la vez: 76,0% frente a 50,3% y 2,9 pg/s frente a 2,1 pg/s. LiteParse cambia la estructura por la velocidad: 1721 pg/s con OCR desactivado, pero 20,4% frente al 43,6% de Marker en CPU. El modo rápido con –disable_ocr se ejecuta completamente en la CPU, sin servidor de inferencia, a 23,7 pg/s. Las licencias dividen el campo: Docling es del MIT, MinerU sigue siendo gratuito con ingresos mensuales de 20 millones de dólares y los pesos de Marker necesitan una licencia paga de más de 5 millones de dólares. Todos los números de referencia y rendimiento se envían con un arnés/puntos de referencia reproducibles.
Explicador dinámico interactivo
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.