DeepSeek acaba de lanzar un modelo 3B OCR: un VLM 3B diseñado para OCR de alto rendimiento y conversión de documentos estructurados

DeepSeek-AI lanzó 3B DeepSeek-OCR, un sistema de modelo de visión-lenguaje (VLM) de análisis de documentos y OCR de extremo a extremo que comprime texto largo en un pequeño conjunto de tokens de visión y luego decodifica esos tokens con un modelo de lenguaje. El método es simple, las imágenes llevan representaciones compactas de texto, lo que reduce la longitud de la secuencia para el decodificador. El equipo de investigación informa una precisión de decodificación del 97% cuando los tokens de texto están dentro de 10 veces los tokens de visión en el punto de referencia de Fox, y un comportamiento útil incluso con una compresión de 20 veces. También informa resultados competitivos en OmniDocBench con muchos menos tokens que las líneas de base comunes.

https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf

Arquitectura, ¿qué es realmente nuevo?

DeepSeek-OCR-3B tiene dos componentes, un codificador de visión llamado DeepEncoder y un decodificador Mixture of Experts llamado DeepSeek3B-MoE-A570M. El codificador está diseñado para entradas de alta resolución con bajo costo de activación y con pocos tokens de salida. Utiliza una etapa de atención de ventana basada en SAM para la percepción local, un compresor convolucional de 2 capas para una reducción de resolución de token de 16 × y una etapa de atención global densa basada en CLIP para la agregación de conocimiento visual. Este diseño mantiene la memoria de activación controlada en alta resolución y mantiene bajo el recuento de tokens de visión. El decodificador es un modelo MoE de parámetros 3B (denominado DeepSeek3B-MoE-A570M) con aproximadamente 570 millones de parámetros activos por token.

https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf

Modos de resolución múltiple, diseñados para presupuestos simbólicos

DeepEncoder admite modos nativos y modos dinámicos. Los modos nativos son Pequeño con 64 tokens de 512 por 512 píxeles, Pequeño con 100 tokens de 640 por 640, Base con 256 tokens de 1024 por 1024 y Grande con 400 tokens de 1280 por 1280. Los modos dinámicos llamados Gundam y Gundam-Master combinan vistas locales en mosaico con una vista global. Gundam produce n×100 más 256 tokens, o n×256 más 400 tokens, con n en el rango de 2 a 9. Para los modos acolchados, el equipo de investigación proporciona una fórmula para tokens válidos, que es menor que el recuento de tokens sin procesar y depende de la relación de aspecto. Estos modos permiten a los desarrolladores e investigadores de IA alinear los presupuestos de tokens con la complejidad de la página.

https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf
https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf

Resultados de la compresión, lo que dicen los números…..

El estudio de referencia de Fox mide la precisión como coincidencia exacta del texto después de la decodificación. Con 100 tokens de visión, las páginas con 600 a 700 tokens de texto alcanzan una precisión del 98,5% con una compresión de 6,7×. Las páginas con entre 900 y 1000 tokens de texto alcanzan una precisión del 96,8% con una compresión de 9,7×. Con 64 tokens de visión, la precisión disminuye a medida que aumenta la compresión, por ejemplo, 59,1 % a aproximadamente 19,7 × para 1200 a 1300 tokens de texto. Estos valores provienen directamente de la Tabla 2.

https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf

En OmniDocBench, el resumen informa que DeepSeek-OCR supera a GOT-OCR 2.0 cuando usa solo 100 tokens de visión por página, y que con menos de 800 tokens de visión supera a MinerU 2.0, que usa más de 6000 tokens por página en promedio. La sección de pruebas comparativas presenta el rendimiento general en términos de distancia de edición.

https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf

Detalles del entrenamiento que importan….

El equipo de investigación describe un proceso de formación en dos fases. Primero entrena a DeepEncoder con la predicción del siguiente token en datos OCR 1.0 y OCR 2.0 y 100 millones de muestras de LAION, luego entrena el sistema completo con paralelismo de canalización en 4 particiones. Para el hardware, la ejecución utilizó 20 nodos, cada uno con 8 GPU A100 40G, y utilizó AdamW. El equipo informa una velocidad de entrenamiento de 90 mil millones de tokens por día en datos de solo texto y 70 mil millones de tokens por día en datos multimodales. En producción, informa la capacidad de generar más de 200.000 páginas por día en un solo nodo A100 40G.

Cómo evaluarlo en una pila práctica

Si sus documentos de destino son informes o libros típicos, comience con el modo Pequeño en 100 tokens, luego ajuste hacia arriba solo si la distancia de edición es inaceptable. Si sus páginas contienen fuentes pequeñas y densas o recuentos de tokens muy altos, utilice un modo Gundam, ya que combina campos de visión globales y locales con un presupuesto de tokens explícito. Si su carga de trabajo incluye gráficos, tablas o estructuras químicas, revise la sección cualitativa “Análisis profundo”, que muestra conversiones a tablas HTML y SMILES y geometría estructurada, luego diseñe resultados que sean fáciles de validar.

https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek_OCR_paper.pdf

Conclusiones clave

DeepSeek OCR apunta a la eficiencia del token utilizando compresión de contexto óptico con decodificación casi sin pérdidas con aproximadamente 10 veces la compresión y alrededor del 60 por ciento de precisión con aproximadamente 20 veces la compresión. El lanzamiento de HF expone presupuestos de tokens explícitos, Tiny usa 64 tokens en 512 por 512, Small usa 100 tokens en 640 por 640, Base usa 256 tokens en 1024 por 1024, Large usa 400 tokens en 1280 por 1280 y Gundam compone n vistas en 640 por 640 más una vista global en 1024 por 1024. La estructura del sistema es un DeepEncoder. que comprime páginas en tokens de visión y un decodificador MoE DeepSeek3B con alrededor de 570 millones de parámetros activos, como lo describe el equipo de investigación en el informe técnico. La tarjeta modelo Hugging Face documenta una configuración probada para uso inmediato, Python 3.12.9, CUDA 11.8, PyTorch 2.6.0, Transformers 4.46.3, Tokenizers 0.20.3 y Flash Attention 2.7.3.

DeepSeek OCR es un paso práctico para la IA de documentos, trata las páginas como portadores ópticos compactos que reducen la longitud de la secuencia del decodificador sin descartar la mayor parte de la información, la tarjeta modelo y el informe técnico describen una precisión de decodificación del 97 por ciento con aproximadamente 10 veces la compresión en el punto de referencia de Fox, que es la afirmación clave para probar en cargas de trabajo reales. El modelo lanzado es un decodificador 3B MoE con una interfaz DeepEncoder, empaquetado para Transformers, con versiones probadas para PyTorch 2.6.0, CUDA 11.8 y Flash Attention 2.7.3, lo que reduce el costo de configuración para los ingenieros. El repositorio muestra un único fragmento de tensores de seguridad de 6,67 GB, que se adapta a las GPU comunes. En general, DeepSeek OCR pone en funcionamiento la compresión de contexto óptico con un decodificador MoE 3B, informa una precisión de decodificación de aproximadamente el 97% con una compresión de 10x en Fox, proporciona modos de presupuesto de token explícitos e incluye una configuración de Transformers probada, valida la afirmación de rendimiento en su propia canalización.

Consulte el documento técnico, Modelo sobre HF y GitHub Repo. No dude en consultar nuestra página de GitHub para tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.

🙌 Siga MARKTECHPOST: agréguenos como fuente preferida en Google.