Imagínese esto: un oficial de cumplimiento necesita una cláusula específica durante una auditoría, un abogado necesita términos de contrato mientras un cliente espera al teléfono, o un analista financiero necesita números del informe del último trimestre antes de una reunión que comienza en 10 minutos. En cada caso, no es práctico esperar a que finalice un trabajo programado. Necesita acceso bajo demanda al texto dentro de sus archivos PDF.
En esta publicación, creará un servidor que extrae texto de archivos PDF en Amazon S3 en tiempo real. Este enfoque basado en protocolos proporciona acceso programático a documentos. Recorrerá la arquitectura, configurará el servidor y ejecutará consultas de documentos interactivos. A lo largo del camino, comparará este enfoque con Amazon Textract para que pueda decidir qué herramienta se adapta a su carga de trabajo.
Creamos esta solución después de trabajar con varios equipos que compartían la misma frustración: sus documentos vivían en Amazon S3, pero obtener texto de ellos a pedido significaba escribir scripts personalizados o esperar en canalizaciones por lotes. Este enfoque de servidor MCP se ubica en el medio y le brinda acceso interactivo con una configuración mínima. La extracción interactiva de texto PDF de Amazon S3 le brinda respuestas en tiempo real de sus documentos sin canalizaciones por lotes ni infraestructura pesada.
Esta opción basada en MCP funciona bien para archivos PDF basados en texto en configuraciones de desarrollo y prueba de concepto. Para el procesamiento de documentos complejos, como el reconocimiento óptico de caracteres (OCR), la extracción de formularios y el análisis de diseño, Amazon Textract sigue siendo la opción recomendada.
¿Quién se beneficia de este enfoque?
Esta solución se adapta a varias funciones comunes. Si estos escenarios le parecen propios de su día a día, siga leyendo.
Equipos legales y de cumplimiento: durante una revisión urgente, es necesario localizar una cláusula específica oculta en un contrato o documento de política de 200 páginas. La búsqueda manual lleva demasiado tiempo. Con esta solución, usted hace una pregunta en lenguaje natural y obtiene el pasaje relevante en segundos.
Equipos de servicios financieros: durante una sesión de auditoría, necesita acceso inmediato a la redacción exacta de una política de riesgo interna o una presentación regulatoria. Esta solución le permite extraer esa información directamente desde su repositorio de documentos de Amazon S3 sin salir de su terminal.
Equipos ejecutivos: durante las reuniones de planificación estratégica, puede consultar un PDF en el momento cuando alguien pregunta sobre un dato del informe de ganancias del último trimestre. No es necesario hojear copias impresas ni esperar a que alguien las busque después de la reunión.
Estos escenarios comparten algunos rasgos comunes: implican necesidades de información en tiempo real donde el procesamiento por lotes es demasiado lento, documentos PDF basados en texto con formato estándar, sensibilidad a los costos en entornos de desarrollo y prueba de concepto, y requisitos de integración con flujos de trabajo y herramientas de AWS existentes.
Amazon Textract es un servicio de IA de AWS totalmente administrado y diseñado específicamente para el procesamiento de documentos a escala. Maneja páginas escaneadas, escritura a mano y diseños de varias columnas. Elija Amazon Textract cuando necesite OCR para documentos escaneados, extracción avanzada de formularios y tablas, análisis de diseño complejo, procesamiento por lotes a escala de producción con requisitos de acuerdo de nivel de servicio (SLA) o funciones de cumplimiento y soporte empresarial.
El enfoque basado en MCP aborda un escenario complementario: brindar a un asistente de IA acceso interactivo y bajo demanda a texto ya codificado dentro de archivos PDF. Elija este patrón cuando sus documentos sean PDF basados en texto (no se requiere OCR), su flujo de trabajo sea interactivo en lugar de por lotes, esté trabajando en entornos de desarrollo o prueba de concepto y desee una infraestructura mínima entre el asistente de IA y el documento fuente. Para todo lo demás, incluido cualquier procesamiento de documentos que se beneficie del OCR o la extracción estructurada, dirija el trabajo a Amazon Textract.
Cómo funciona la solución
Con esta solución, conecta su asistente de IA directamente a sus documentos PDF en Amazon S3 y puede obtener respuestas rápidamente. En el fondo, la solución utiliza el Protocolo de contexto modelo (MCP), un estándar abierto que proporciona una forma estructurada de acceder a fuentes de datos externas. MCP actúa como una capa de comunicación entre su aplicación y sus datos. La arquitectura tiene cuatro componentes: una interfaz de línea de comandos como interfaz de usuario, la capa MCP para la comunicación, un servidor MCP personalizado para el procesamiento de PDF y Amazon S3 para el almacenamiento de documentos, protegido por AWS Identity and Access Management (AWS IAM).
Comparación de costos
Elija el enfoque que se ajuste a su presupuesto y requisitos. Para aproximadamente 10.000 páginas PDF basadas en texto por mes en un entorno de prueba de concepto, así es como se comparan los dos enfoques:
Estas dos cifras son precios para diferentes conjuntos de características y no deben leerse como una comparación de precios directa. Utilícelos para elegir la herramienta adecuada para la carga de trabajo, no para optimizar únicamente el dinero. Si su carga de trabajo incluye documentos escaneados, formularios, tablas, diseños complejos o acuerdos de nivel de servicio de producción, Amazon Textract es la opción adecuada y las capacidades adicionales se reflejan en su precio.
Alcance de Amazon Textract: procesamiento a nivel de página, listo para OCR, extracción de formularios y tablas, comprensión del diseño, acuerdos de nivel de servicio empresariales
Costo mensual indicativo: procesamiento de Amazon Textract de aproximadamente $15, almacenamiento de Amazon S3 de $2, procesamiento de AWS Lambda de $1 y procesamiento de tokens de modelo de lenguaje grande (LLM) de aproximadamente $5 a $10, para un total de aproximadamente $23 a $28.
Alcance del servidor MCP: extracción directa de texto de archivos PDF cuyo texto ya está codificado; no hay ningún servicio de procesamiento gestionado involucrado
Costo mensual indicativo: almacenamiento de Amazon S3 $2 y transferencia de datos $0,50, para un total de aproximadamente $2,50.
Todas las cifras de costos son ilustrativas y pueden cambiar. Consulte las páginas oficiales de precios de AWS para conocer las tarifas actuales.
Descripción general de la arquitectura
El siguiente diagrama de secuencia ilustra el flujo de trabajo de un extremo a otro para extraer texto de un PDF almacenado en Amazon S3. El proceso comienza cuando el cliente AI inicia una solicitud de extracción de PDF a través de la CLI. El sistema reenvía esta solicitud al servidor MCP, que recupera el archivo PDF de Amazon S3 utilizando el depósito y la clave de objeto proporcionados.
Después de que el servidor MCP recupera el PDF, pasa el archivo a un componente de análisis de PDF. El componente procesa el documento y extrae el contenido textual. Luego, el servidor MCP devuelve el texto extraído al cliente, y el cliente lo muestra al usuario.
Implementación paso a paso
Siga estos pasos para instalar y configurar la solución de extracción de texto PDF. Comience confirmando que tiene implementados los requisitos previos requeridos.
Requisitos previos
Antes de comenzar, confirme que tiene listos los siguientes elementos. También necesitará conocimientos básicos de programación Python y servicios de AWS.
Una cuenta de AWS con permisos de lectura de Amazon S3. Python 3.10 o posterior instalado. Interfaz de línea de comandos de AWS (AWS CLI) configurada con credenciales válidas. Kiro CLI instalado.
Instalación
Esta sección lo guía a través de la instalación del servidor MCP y sus dependencias. El proceso implica crear un entorno virtual Python, instalar los paquetes necesarios y crear el archivo del servidor. Siga estos pasos en orden. Ejecute cada comando en su terminal.
Antes de comenzar, necesitas:
Python 3.10 o posterior instalado en su máquina. La CLI de Kiro se instaló e inició sesión. Las credenciales de AWS configuradas en su máquina (ejecute aws configure si no lo ha hecho). Un depósito de S3 que contiene al menos un archivo PDF.
Paso 1: crea una carpeta para el proyecto
Ejecute estos dos comandos en su terminal:
Paso 2: navega a la carpeta del proyecto
Ejecute este comando:
Paso 3: cree un entorno virtual de Python
Ejecute este comando:
Paso 4: active el entorno virtual
Ejecute este comando:
Después de esto, el indicador de su terminal mostrará (venv) al principio. Mantenga esta terminal abierta. Debe permanecer en este entorno virtual para los siguientes pasos.
Paso 5: instale los paquetes de Python necesarios
Ejecute este comando:
Espere a que termine. Debería terminar con "Instalado correctamente…".
Paso 6: crea el archivo del servidor
Dentro de la carpeta ~/s3-pdf-extractor, cree un nuevo archivo con el nombre exacto:
Pegue el siguiente código en ese archivo y guárdelo:
Paso 7: prueba que el servidor se inicia
En su terminal (aún dentro de la carpeta s3-pdf-extractor con el venv activo), ejecute:
El terminal aparecerá en “pausa” sin salida. Eso es correcto. Significa que el servidor está funcionando y esperando solicitudes. Presione Ctrl+C para detenerlo.
Si ve un error, vuelva a verificar los pasos 2 y 3.
Paso 8: Localice o cree el archivo de configuración de Kiro CLI
Kiro CLI utiliza un archivo de configuración JSON para saber qué servidores MCP están disponibles. Debe agregar su servidor a este archivo.
El archivo de configuración de Kiro CLI MCP se encuentra en:
Si este archivo no existe, créelo ejecutando estos comandos en su terminal:
Paso 9: agregue la configuración del servidor MCP
Pegue el siguiente JSON en el archivo. Reemplace /path/to/s3_pdf_extractor.py con la ruta real del Paso 1 (por ejemplo, ~/s3-pdf-extractor/s3_pdf_extractor.py):
Para obtener la ruta absoluta completa, ejecute echo ~/s3-pdf-extractor/s3_pdf_extractor.py en su terminal y use esa salida en el campo args.
Paso 10: guarde el archivo de configuración
Presione Ctrl+O, luego presione Entrar para guardar el archivo.
Paso 11: cierra el editor de archivos
Presione Ctrl+X para salir de nano.
Paso 12: reinicie Kiro CLI
Reinicie Kiro CLI para cargar la nueva configuración. Cierre y vuelva a abrir Kiro CLI o ejecute:
Paso 13: verificar la conexión del servidor MCP
Verifique la conexión ejecutando una extracción de prueba en Kiro CLI:
Consideraciones de seguridad
La seguridad está integrada desde el principio, no se agrega como una ocurrencia tardía. Así es como lo maneja la solución:
Integración de IAM: la solución utiliza sus credenciales de AWS existentes. No es necesario crear ni administrar claves API independientes. Acceso con privilegios mínimos: solo otorga permisos de lectura a Amazon S3, limitados a los depósitos específicos que contienen sus documentos PDF. Nada más. Almacenamiento temporal: el servidor elimina los archivos descargados automáticamente una vez que completa el procesamiento. No quedan datos PDF en el sistema de archivos local. Sin persistencia de datos: la extracción de texto se produce bajo demanda sin almacenar resultados. Seguimiento de auditoría: AWS CloudTrail registra las solicitudes de acceso a Amazon S3 para su cuenta.
Rendimiento y limitaciones
Esto es lo que puede esperar en términos de rendimiento:
El servidor procesa documentos en tiempo real. Para un PDF típico basado en texto de 50 páginas, los resultados generalmente están disponibles en unos segundos, lo que lo hace práctico para flujos de trabajo interactivos en los que se hacen preguntas de seguimiento. El tiempo de procesamiento aumenta linealmente con el tamaño del documento. Un documento de 10 páginas se procesa aproximadamente 5 veces más rápido que uno de 50 páginas. El uso de la memoria es proporcional al tamaño del documento. Para la mayoría de los archivos PDF basados en texto de menos de 100 páginas, el consumo de memoria se mantiene dentro de los límites típicos de las máquinas de desarrollo.
Este enfoque tiene límites claros. Conócelos antes de comprometerte:
Solo archivos PDF basados en texto. Si sus documentos son imágenes escaneadas o fotografías en papel, el servidor no puede leerlas. Amazon Textract maneja esos casos de forma nativa con OCR. Sin capacidad de OCR. El servidor lee el texto incrustado del formato de archivo PDF. No puede interpretar los píxeles de una imagen. Comprensión limitada del diseño. El servidor realiza una extracción de texto sencilla. No reconstruye tablas, columnas ni diseños de páginas complejos. Amazon Textract maneja esto de forma nativa. Sin procesamiento de formularios. Si sus archivos PDF contienen campos de formulario que se pueden completar o datos estructurados, el servidor no extrae esos elementos. Amazon Textract maneja esto de forma nativa.
Casos de uso del mundo real
Estas capacidades se traducen directamente en resultados mensurables en todas las industrias. Ya sea que se trate de equipos legales que recuperan cláusulas contractuales a mitad de una llamada, funcionarios de cumplimiento que localizan el lenguaje de las políticas durante las auditorías o ejecutivos que obtienen datos de ganancias en tiempo real, la solución elimina la fricción de la búsqueda manual de documentos. Los siguientes ejemplos muestran cómo diferentes equipos lo ponen en práctica.
firma de servicios legales
Una firma legal de tamaño mediano adoptó esta solución para la revisión de contratos. Sus abogados solían dedicar entre 15 y 20 minutos a buscar contratos en PDF para encontrar cláusulas de indemnización específicas durante las llamadas de los clientes. Eso significaba poner al cliente en espera o prometerle que volvería a llamar más tarde. Ahora escriben una pregunta en Kiro CLI y obtienen el pasaje relevante en segundos. La firma informa que el tiempo de investigación durante las llamadas de los clientes se redujo significativamente.
Cumplimiento de servicios financieros
Un banco regional implementó la solución para exámenes regulatorios. Durante las auditorías, los funcionarios de cumplimiento deben localizar rápidamente el lenguaje de políticas específico. Anteriormente, marcaban manualmente secciones clave en docenas de archivos PDF, lo que era propenso a errores y difícil de mantener a medida que cambiaban las políticas. Con el servidor MCP conectado a su repositorio de documentos S3, ahora obtienen el párrafo exacto sobre el que pregunta un examinador en tiempo real.
equipo de estrategia corporativa
Un equipo de liderazgo empresarial utiliza la solución durante las reuniones estratégicas trimestrales. Cuando un miembro de la junta pregunta sobre una métrica específica del informe de ganancias del trimestre anterior, el equipo consulta el PDF en el momento en lugar de hojear copias impresas. Esto mantiene las discusiones en movimiento y basadas en datos reales.
Opciones de escalado y mejora
Esta solución es un punto de partida. A medida que sus necesidades crezcan, podrá ampliarlas. Comience con el almacenamiento en caché si su equipo accede a los mismos documentos repetidamente. Considere el procesamiento por lotes cuando necesite manejar cientos de documentos a la vez. Agregue búsqueda vectorial cuando la concordancia de palabras clave ya no sea suficiente.
Específicamente, puede ampliar la solución de estas maneras:
Agregue almacenamiento en caché con Amazon DynamoDB para los documentos a los que se accede con frecuencia. Implemente el procesamiento por lotes con Amazon Simple Queue Service (Amazon SQS) para operaciones masivas. Integre la búsqueda vectorial con Amazon OpenSearch Service para el descubrimiento semántico de documentos. Cree flujos de trabajo híbridos que enrute documentos complejos a Amazon Textract automáticamente. Agregue monitoreo con Amazon CloudWatch para rastrear patrones de uso y tasas de error.
Limpieza
Cuando haya terminado de probar o desee eliminar la solución, siga estos pasos para evitar costos innecesarios.
Detenga el servidor MCP. Presione Ctrl+C en la terminal donde se está ejecutando el servidor. Eliminar la configuración de MCP Abra su archivo de configuración Kiro CLI MCP (~/.kiro/settings/tools/mcp.json) y elimine la entrada s3-pdf-extractor. Guarde y cierre el archivo. Eliminar los archivos del proyectoEliminar el directorio del proyecto y todo su contenido:
Advertencia: este comando elimina permanentemente todos los archivos del directorio sin confirmación. Asegúrese de haber guardado todas las modificaciones antes de continuar.
Limpiar recursos de S3 (opcional) Si creó archivos PDF de prueba en Amazon S3 específicamente para este tutorial, elimine los archivos de prueba o el depósito de prueba mediante la consola de Amazon S3 o la CLI de AWS:
Elimine únicamente los recursos que creó para las pruebas.
Revisar los permisos de IAM (opcional) Navegue hasta la consola de IAM y elimine los permisos de lectura de S3 agregados específicamente para esta solución. Mantenga los permisos de los que dependen otros flujos de trabajo. Verificar limpiezaConfirmar que el directorio ya no existe:
Resultado esperado: no existe tal archivo o directorio
Después de la limpieza, ya no incurrirá en cargos de transferencia de datos y almacenamiento de S3 por los recursos que eliminó. Para obtener información detallada sobre precios, consulte Precios de Amazon S3. Si desea volver a implementar más tarde, repita los pasos de instalación. Todo el código y los ejemplos de configuración permanecen en este documento.
Conclusión
En esta publicación, creó un servidor MCP que extrae texto de archivos PDF en Amazon S3 en tiempo real. Recorrió la arquitectura, comparó los costos con Amazon Textract y vio cómo tres equipos diferentes pusieron en práctica este enfoque. El patrón sigue un enfoque claro: conecte su asistente de IA a sus documentos, mantenga la infraestructura al mínimo y escale solo cuando la carga de trabajo lo requiera.
En resumen, el patrón del servidor MCP es un complemento interactivo y enfocado a Amazon Textract. Úselo cuando un asistente de IA necesite leer archivos PDF basados en texto en tiempo real. Cuando sus necesidades incluyen OCR, formularios, tablas o procesamiento a escala de producción, Amazon Textract es el servicio de AWS diseñado para ese trabajo y los dos enfoques encajan perfectamente. Este es exactamente el patrón que se muestra en la opción de flujo de trabajo híbrido anteriormente en esta publicación.
Próximos pasos:
Evalúe su caso de uso según los criterios de la sección "Dónde encaja este enfoque junto con Amazon Textract". Implemente la solución en su entorno de desarrollo siguiendo la sección Instalación de esta publicación. Pruebe con 5 a 10 documentos representativos para establecer el rendimiento de referencia. Explore Amazon Textract para conocer las capacidades de OCR u obtenga más información sobre la integración de Kiro CLI a medida que evolucionan sus requisitos. Si prueba esta solución o la adapta a su propio caso de uso, nos encantaría saberlo en los comentarios.
Para obtener más información, explore los siguientes recursos: