Una página escaneada del anuario contiene 176 nombres impresos, 4 fotografías de retratos y ninguna estructura legible por máquina que los vincule. Para digitalizar esta página, necesita una detección de fotografías confiable con cuadros delimitadores y una extracción precisa de nombres. También necesita una forma de determinar qué nombre pertenece a qué cara según el diseño de la página.
En esta publicación, mostramos cómo combinar Amazon Nova 2 Lite con Claude Sonnet 4.6 de Anthropic ofrece una solución eficiente para digitalizar documentos escaneados a escala. Construimos un canal de dos modelos en Amazon Bedrock para digitalizar páginas escaneadas del anuario. Amazon Nova 2 Lite maneja la extracción multimodal nativa en una sola llamada: detecta fotos, extrae nombres visibles con coordenadas y devuelve metadatos a nivel de página. Luego, Claude Sonnet 4.6 realiza un razonamiento espacial para hacer coincidir nombres con caras según el diseño de la página.
Ejecutamos este proceso en 336 páginas escaneadas del anuario y produjimos 3122 asociaciones de nombres, con un 93 por ciento con una puntuación de confianza de 0,95 o superior. Este enfoque de dos modelos cuesta alrededor de dos tercios menos por página que una alternativa de modelo único que envía toda la tarea a un modelo de visión y lenguaje. Consulte la sección Consideraciones de costos para obtener un desglose detallado.
Descripción general de la solución
El oleoducto tiene dos etapas. Cada etapa utiliza un modelo diferente, elegido para la tarea específica que realiza.
Figura 1. Arquitectura de canalización de dos modelos. La imagen de la página escaneada pasa por dos etapas secuenciales. En la etapa 1, Amazon Nova 2 Lite realiza una extracción multimodal nativa en una única llamada API. Detecta y clasifica fotografías con cuadros delimitadores, lee los nombres visibles en la página y devuelve sus posiciones aproximadas, y emite metadatos a nivel de página. En la etapa 2, Claude Sonnet 4.6 realiza un razonamiento espacial para hacer coincidir nombres con caras utilizando la salida combinada de Nova.
Amazon Nova 2 Lite se ejecuta primero. Debido a que maneja texto e imágenes entrelazados de forma nativa, una sola llamada de Converse devuelve tres cosas:
Las fotografías detectadas con cuadros delimitadores y clasificaciones. Los nombres visibles en la página con posiciones aproximadas. Metadatos a nivel de página como títulos y categorías.
Configuramos el razonamiento en BAJO para esta tarea al incluir una configuración de razonamiento en la llamada API de Converse. Consulte el bloque de razonamiento en el código del Paso 1 que sigue. Las pruebas en las 336 páginas no mostraron diferencias significativas en la precisión entre los niveles de razonamiento BAJO, MEDIO y ALTO para esta extracción estructurada, y BAJO es la opción más barata. Nova expone esta configuración a través del campo Reasoning_config. Claude, en el Paso 2, utiliza un campo de pensamiento separado, por lo que los dos modelos controlan el razonamiento con nombres diferentes.
Pedirle a Nova 2 Lite solo los nombres, no todos los tokens OCR de la página, es lo que mantiene barata la primera etapa. El paso posterior de razonamiento espacial no necesita el texto completo de las listas de clases ni las descripciones de eventos. Necesita nombres que aparezcan cerca de las fotos. Restringir la salida de Nova a nombres mantiene el costo del token de salida en aproximadamente 1000 tokens por página en lugar de los 4500 tokens aproximados que produciría una pasada completa de OCR.
Claude Sonnet 4.6 entra sólo en la etapa 2 para el paso de razonamiento espacial. Dados los nombres con posiciones de Nova y los cuadros delimitadores de fotografías, Claude determina qué nombres corresponden a qué caras. Este paso requiere manejar la variabilidad del diseño de la página, porque los diseños del anuario varían de una página a otra. Los subtítulos pueden aparecer encima o debajo de las fotos, y algunas páginas mezclan cuadrículas de retratos con fotografías grupales. El pensamiento adaptativo de Claude maneja esta variabilidad sin necesidad de ingeniería adicional por tipo de diseño.
En esta solución, Nova 2 Lite maneja el trabajo de extracción de gran volumen de forma nativa, en una sola llamada. A Claude se le llama una vez por página para el paso de razonamiento espacial.
Precio fijo por imagen de Nova 2 Lite: costo predecible a escala
Un cambio reciente en la forma en que Amazon Nova 2 Lite factura las entradas de imágenes hace que el costo por página sea predecible a escala, lo cual es importante cuando se procesan cientos de miles de páginas.
Precio fijo por imagen: Amazon Nova 2 Lite factura las entradas de imágenes y páginas de documentos a una tarifa fija por imagen, independientemente de la resolución o el tamaño del archivo.
Este cambio es importante para los canales de procesamiento de documentos. Anteriormente, los costos de los tokens de imágenes variaban según la resolución, lo que dificultaba proyectar los costos por página sin realizar una prueba de concepto en muestras representativas. Con la facturación fija, cada imagen que procesa Nova 2 Lite se factura con la misma tarifa por imagen, independientemente de la resolución.
Para una extracción de página completa que incluye el mensaje y la salida, el costo por página se desglosa de la siguiente manera:
Tokens de componente/Tarifa de página Costo/Tokens de imagen de página (fijo) 230 $0,30/M de entrada $0,000069 Tokens de aviso (estimado) 500 $0,30/M de entrada $0,000150 Tokens de salida (estimado) 1.000 $2,50/M de salida $0,0025 Total ~$0,0027
Según las tarifas de token de entrada publicadas de Nova 2 Lite, la entrada de imágenes es una pequeña fracción del costo total por página. Para conocer las tarifas actuales, consulte la página de precios de Amazon Bedrock.
Para cargas de trabajo a escala de anuario (cientos de miles de páginas al año), este precio fijo hace que la previsión de costos sea sencilla porque el costo de entrada de imágenes aumenta linealmente con el número de páginas y es independiente de la resolución de la página. No se requiere normalización de resolución.
Pensamiento adaptativo para el razonamiento espacial.
Claude en Amazon Bedrock admite el pensamiento adaptativo, una característica en la que el modelo decide cuánto razonamiento interno aplicar en función de la complejidad de la entrada. Lo habilita configurando el tipo en adaptable en la configuración de pensamiento de la API de Converse:
Con el pensamiento adaptativo habilitado, Claude ajusta la profundidad de su razonamiento en función de lo que recibe. Una cuadrícula de retratos sencilla con ocho nombres cuidadosamente dispuestos sobre ocho caras obtiene una respuesta directa con un razonamiento mínimo. Una página donde tres fotos de grupo comparten un bloque de título y los nombres aparecen en una barra lateral desencadena un análisis espacial paso a paso.
En nuestra tirada de 336 páginas, Claude utilizó un razonamiento extendido en cada página, con rastros de razonamiento que oscilaban entre 544 y 1.658 caracteres. Incluso las páginas más simples se beneficiaron de algún análisis espacial porque los diseños del anuario rara vez son perfectamente uniformes. Los rastros de razonamiento muestran a Claude trabajando en la alineación de las columnas y los desplazamientos verticales entre las posiciones de los nombres y las posiciones de las caras, y comprobando la proximidad de los subtítulos cuando aparecen fotos de grupo en la página.
Para este tipo de tarea espacial estructurada, el pensamiento adaptativo le brinda la cantidad adecuada de razonamiento por página sin ajuste manual. No es necesario establecer un presupuesto de token fijo ni escribir indicaciones específicas para el diseño. El modelo lee las entradas y decide.
Nota sobre costos sobre el pensamiento adaptativo: cuando se habilita el pensamiento adaptativo, tenga en cuenta tres factores de costos.
Los tokens de razonamiento se facturan como tokens de salida a la tarifa de salida estándar ($15,00/M de tokens de salida para Claude Sonnet 4.6 mediante inferencia entre regiones). Los rastros de razonamiento se devuelven en la respuesta de la API en un bloque de contenido de pensamiento independiente, pero no se muestran a los usuarios finales. Supervise los tokens de entrada y los tokens de salida en los metadatos de respuesta para realizar un seguimiento del costo real por página, porque el razonamiento puede aumentar significativamente el recuento de tokens de salida en páginas complejas.
Tutorial de implementación
El código fuente completo, las imágenes de muestra y el cuaderno de Jupyter están disponibles en el repositorio de muestras de AWS en GitHub.
Requisitos previos
Antes de ejecutar la canalización, asegúrese de tener lo siguiente en su lugar:
Una cuenta de AWS con acceso a Amazon Bedrock en una región de AWS donde Amazon Nova 2 Lite y Claude Sonnet 4.6 estén disponibles. Acceso al modelo habilitado en la consola de Amazon Bedrock tanto para us.amazon.nova-2-lite-v1:0 como para us.anthropic.claude-sonnet-4-6. Una entidad principal de AWS Identity and Access Management (IAM) con permiso para llamar a bedrock:InvokeModel y bedrock:Converse en los dos modelos anteriores. Python 3.10 o posterior con el SDK de boto3 instalado. El cuaderno de muestra también utiliza rapidfuzz para coincidencias aproximadas de nombres y Pillow para superposiciones de visualización. Imágenes de páginas escaneadas (JPEG o PNG). Para la entrada de imágenes a través de la API de Converse, los bytes de imagen se pasan en línea en la solicitud.
Paso 1: Detecta fotos y extrae nombres con Amazon Nova 2 Lite
Envíe la página escaneada a Amazon Nova 2 Lite con un mensaje que solicita tanto las fotos detectadas (con cuadros delimitadores y clasificaciones) como los nombres visibles (con posiciones aproximadas en la página). La comprensión multimodal nativa de Nova devuelve ambos en una sola llamada de Converse.
Nova devuelve cuadros delimitadores en una escala de coordenadas de 0 a 1000 tanto para fotos como para nombres. Pase ambos directamente al Paso 2. Claude lee el mismo espacio de coordenadas cuando se le indica en el mensaje, por lo que no es necesaria ninguna conversión.
El mensaje le indica a Nova que devuelva un objeto JSON con las fotos y los nombres visibles en la página.
Cada foto tiene un cuadro delimitador, un tipo (retrato, grupo o sincero), una etiqueta de categoría y una breve descripción. Cada nombre obtiene su texto visible y su cuadro delimitador en la página. Los campos page_title y categoría también sirven para un segundo caso de uso: extracción de metadatos. Con una llamada API, Nova 2 Lite le brinda detección de fotografías, nombres con posiciones para el canal coincidente y metadatos estructurados. Puede utilizar estos metadatos para indexar búsquedas, filtrar por tipo de evento o crear una tabla de contenido en cientos de páginas.
Paso 2: une nombres con caras con Claude
Ahora pase los nombres con posiciones de Nova y los cuadros delimitadores de fotografías a Claude para que realice razonamiento espacial. Ambos usan el mismo espacio de coordenadas de 0 a 1000, por lo que no se necesita normalización:
En la página 50 de nuestro conjunto de pruebas, Nova arrojó 176 entradas de nombres y 4 cuadros delimitadores de fotografías. La mayoría de esos nombres están en la lista y en el cuerpo del texto en otras partes de la página. Sólo los nombres adyacentes a las 4 fotos son compatibles, por lo que Claude produjo 5 asociaciones:
Cada asociación incluye una cadena de razonamiento que explica la lógica espacial. Esto es útil para depurar páginas donde fallan las asociaciones.
Paso 3: validar y reunir resultados
El último paso aplica umbrales de confianza y coincidencias de nombres difusas (usando rapidfuzz) para filtrar asociaciones de baja calidad. La canalización escribe dos resultados por página: un archivo JSON con los datos de asociación y una imagen de visualización que muestra líneas dibujadas entre nombres y caras coincidentes.
Resultados
Procesamos 336 páginas escaneadas del anuario a través de este canal. El proyecto produjo 3.122 asociaciones de nombre a cara en total, y el 93,3 por ciento de esas asociaciones obtuvieron una puntuación de confianza igual o superior a 0,95. Sólo el 0,3 por ciento cayó por debajo del umbral de confianza de 0,90.
Figura 2. Distribución de la puntuación de confianza entre las 3122 asociaciones de nombre a cara producidas a partir de 336 páginas escaneadas del anuario. La distribución está muy sesgada hacia un nivel de confianza alto: 2.912 asociaciones (93,3 por ciento) obtuvieron una puntuación igual o superior a 0,95, 202 (6,5 por ciento) obtuvieron una puntuación entre 0,90 y 0,94, y sólo 8 (0,3 por ciento) cayeron por debajo de 0,90. Claude Sonnet 4.6 produjo puntuaciones de confianza durante el paso de razonamiento espacial. Reflejan la certeza del modelo de que un token de nombre determinado se asigna a un cuadro delimitador de cara específico.
Las páginas de cuadrícula vertical (282 de 336 páginas) promediaron 10,9 asociaciones por página. Estas páginas tienen un diseño regular donde los nombres aparecen directamente encima o debajo de las fotos correspondientes, y el proceso los maneja de manera confiable. Las páginas de solo texto (listas de clases, descripciones de eventos, páginas de índice) no tenían fotografías para detectar y se omitieron correctamente. Las páginas de diseño mixto con retratos y fotografías de grupo en la misma página produjeron asociaciones parciales. El proceso comparó nombres con fotografías de retratos, pero dejó fotos de grupo sin igual cuando los títulos eran ambiguos.
La canalización genera un informe JSON y una visualización para cada página. La visualización dibuja líneas de colores desde cada token de nombre hasta su cara correspondiente, lo que facilita detectar errores durante la revisión manual.
Consideraciones de costos
La división de dos modelos significa que usted paga tarifas Nova 2 Lite por la llamada de extracción combinada (fotos, nombres con posiciones, metadatos) y tarifas Claude por una llamada de razonamiento por página. Según el precio fijo por imagen de Nova 2 Lite, el costo de la primera etapa es predecible e independiente de la resolución de entrada. El paso de razonamiento de Claude domina el costo por página.
Desglose de costos por página
Etapa Costo del servicio Controlador Costo aproximado/página Foto + extracción de nombre Amazon Nova 2 Lite Fijo 230 tokens de imagen + ~500 mensajes + ~1000 resultados ~$0,0027 Razonamiento espacial Claude Sonnet 4.6 Imagen + Nova JSON + tokens de razonamiento adaptativo ~$0,030 Total de canalización ~$0,033
La siguiente tabla compara la canalización con un enfoque de modelo único en el que cada página se envía a Claude para realizar las tres tareas (OCR, detección de fotografías y coincidencia espacial) en una sola llamada.
Dimensión Tubería de dos modelos Claude de modelo único Imagen de tokens de entrada (Nova: 230 fijos) + Nova JSON → Imagen de Claude @ ~1500 tokens + mensaje @ ~1300 = ~2800 tokens @ $3/M = ~$0,008 Tokens de salida Nova: ~1000 nombres-JSON; Razonamiento de Claude: ~1700 @ $15/M = ~$0,026 ~6000 tokens @ $15/M = ~$0,09 Costo por página ~$0,033 ~$0,10 Costo por 100.000 páginas ~$3300 ~$9800 Calidad de OCR Multimodal nativo de Nova (sin servicio de OCR independiente) Modelo general de visión y lenguaje Capacidad de sintonización Intercambie o ajuste cada etapa de forma independiente Aviso monolítico; cambios de todo o nada
Con 100.000 páginas, esa es una diferencia de ~$6.500. Más allá del costo, la tubería dividida también le brinda la posibilidad de intercambiar o ajustar cada etapa de forma independiente sin tocar las demás. Por ejemplo, puedes actualizar solo el modelo de razonamiento cuando se envía un nivel de Claude mejor.
El costo exacto por página depende de tres factores:
Su nivel de precios de Amazon Bedrock. El número de nombres que emite Nova (escala con la densidad de páginas). La cantidad de fichas de razonamiento que utiliza Claude (escalas con complejidad del diseño).
Para obtener una estimación aproximada, agregue una llamada de Nova 2 Lite Converse con una sola entrada de imagen y un mensaje de nombres y fotos. Luego agregue una llamada de Claude Converse donde la entrada incluya la imagen más la salida Nova JSON. Consulte los precios de Amazon Bedrock para conocer las tarifas actuales.
Costo real de nuestra prueba de 336 páginas
Según nuestra ejecución de canalización (336 páginas, promedio de 10,9 asociaciones por página):
Componente Costo estimado Foto de Nova 2 Lite + extracción de nombre (336 páginas × $0,0027) ~$0,91 Razonamiento espacial de Claude (336 páginas × $0,030) ~$10,08 Total ~$10,99 para 336 páginas (~$0,033/página)
Palancas adicionales de optimización de costes
Para cargas de trabajo de gran volumen o que no son en tiempo real:
Inferencia por lotes de Amazon Bedrock: 50 por ciento de descuento en llamadas Nova 2 Lite y Claude para cargas de trabajo que se pueden procesar durante la noche. Envíe un archivo JSONL de solicitudes a Amazon Simple Storage Service (Amazon S3), deje que Amazon Bedrock procese de forma asincrónica y lea los resultados a la mañana siguiente. Al precio por lotes, la etapa combinada del Nova 2 Lite cae de ~$0,0027 a ~$0,0014 por página. Almacenamiento en caché de avisos: si utiliza el mismo aviso de detección de fotografías en miles de páginas (como lo hace este canal), el almacenamiento en caché de avisos puede reducir los costos de los tokens de avisos almacenados en caché hasta en un 90 por ciento. Control del presupuesto de razonamiento: para Claude, puede establecer un límite de tokens de presupuesto en el pensamiento para limitar los costos de los tokens de razonamiento en páginas más simples y, al mismo tiempo, permitir un razonamiento más profundo cuando sea necesario.
Estado latente
Cada página pasa por dos llamadas API secuenciales, por lo que la latencia total por página es la suma de ambas. En nuestra prueba, el paso de razonamiento espacial de Claude fue el que tomó más tiempo, aproximadamente entre 20 y 30 segundos por página, debido a la entrada de imágenes y el razonamiento adaptativo. Nova 2 Lite se completó en unos segundos. Para el procesamiento por lotes, puede realizar paralelización entre páginas porque cada página es independiente.
Etapa Latencia típica Nova 2 Lite (fotos + extracción de nombres) 2 a 5 segundos Razonamiento espacial de Claude (pensamiento adaptativo) 20 a 30 segundos Total por página ~22 a 35 segundos
Limpiar
Esta canalización utiliza servicios de AWS sin servidor sin infraestructura persistente para administrar:
Amazon Bedrock: pago por llamada para Nova 2 Lite y Claude, sin puntos finales aprovisionados que eliminar. Amazon S3: si cargó imágenes del anuario en Amazon S3 para su procesamiento, elimine el depósito o los objetos cuando haya terminado. La eliminación de Amazon S3 es permanente e irreversible. Confirme que tiene copias de seguridad o que ya no necesita los datos antes de eliminarlos. Roles de IAM: elimine cualquier rol creado específicamente para esta canalización (Amazon Bedrock invoca permisos para Nova 2 Lite y Claude Sonnet 4.6).
Conclusión
En esta publicación, mostramos cómo dividir el procesamiento de documentos en dos modelos en Amazon Bedrock produjo 3122 asociaciones de nombres en 336 páginas del anuario, con un 93 por ciento de confianza alta. Amazon Nova 2 Lite manejó la detección de fotografías y la extracción de nombres en una única llamada nativa multimodal. Claude Sonnet 4.6 manejó el razonamiento espacial con pensamiento adaptativo para unir nombres con las caras correctas.
Este patrón se aplica más allá de los anuarios. Cualquier documento con fotografías y texto asociado (archivos históricos, directorios de personal, listados de bienes raíces, catálogos de productos) necesita las mismas capacidades: detectar elementos visuales, extraer el texto relevante y conectar ambos mediante el razonamiento espacial. La solución que describimos en esta publicación combina detección de fotografías, extracción de texto y razonamiento espacial para ofrecer rentabilidad y alta precisión.
El cuaderno completo y los resultados de muestra están disponibles en el repositorio de muestras de AWS en GitHub.
Para obtener más información sobre los servicios utilizados en esta publicación, consulte los siguientes recursos: