Amazon es una empresa global de tecnología y comercio electrónico que opera una amplia red de centros logísticos para almacenar, procesar y enviar productos a clientes de todo el mundo. El equipo de Amazon Global Engineering Services (GES) es responsable de facilitar la preparación operativa en toda la red de centros logísticos en rápida expansión de la empresa. Al lanzar nuevos centros logísticos, Amazon debe verificar que cada instalación esté adecuadamente equipada y lista para operar. Este proceso se denomina prueba de preparación operativa (ORT) y normalmente requiere 2000 horas de esfuerzo manual por instalación para verificar más de 200 000 componentes en 10 500 estaciones de trabajo. Utilizando los modelos de Amazon Nova, hemos desarrollado una solución automatizada que reduce significativamente el tiempo de verificación y mejora la precisión.
En esta publicación, analizamos cómo se puede utilizar Amazon Nova en Amazon Bedrock para implementar una solución de reconocimiento de imágenes basada en IA que automatiza la detección y validación de los componentes del módulo, lo que reduce significativamente los esfuerzos de verificación manual y mejora la precisión.
Comprender el proceso de TRO
ORT es un proceso de verificación integral que garantiza que los componentes estén instalados correctamente antes de que nuestro centro logístico esté listo para su lanzamiento. La lista de materiales (BOM) sirve como lista de verificación maestra y detalla cada componente que debe estar presente en cada módulo de la instalación. A cada componente o artículo en el centro logístico se le asigna un número de identificación único (UIN) que sirve como identificador distintivo. Estos componentes son esenciales para un seguimiento, verificación y gestión de inventario precisos durante todo el proceso de ORT y más allá. En esta publicación nos referiremos a UIN y componentes indistintamente.
El flujo de trabajo ORT tiene cinco componentes:
Plan de pruebas: los evaluadores reciben un plan de pruebas, que incluye una lista de materiales que detalla los componentes exactos y las cantidades requeridas. Recorrido: los evaluadores recorren el centro logístico y se detienen en cada módulo para revisar la configuración con respecto a la lista de materiales. Un módulo es una estación de trabajo física o área operativa Verificar: verifican la instalación y configuración adecuadas de cada UIN Prueba: realizan pruebas funcionales (es decir, energía, conectividad, etc.) en cada componente Documento: documentan los resultados de cada UIN y pasan al siguiente módulo
Encontrar el enfoque correcto
Evaluamos múltiples enfoques para abordar el desafío de la automatización ORT, con un enfoque en el uso de capacidades de reconocimiento de imágenes de modelos básicos (FM). Los factores clave en el proceso de toma de decisiones incluyen:
Capacidad de detección de imágenes: seleccionamos Amazon Nova Pro para la detección de imágenes después de probar múltiples modelos de IA, incluidos Anthropic Claude Sonnet, Amazon Nova Pro, Amazon Nova Lite y Meta AI Segment Anything Model (SAM). Nova Pro cumplió con los criterios para la implementación de producción.
Características de Amazon Nova Pro:
Capacidades de detección de objetos
Diseñado específicamente para la detección de objetos Proporciona coordenadas precisas del cuadro delimitador. Resultados de detección consistentes con cuadros delimitadores.
Procesamiento de imágenes
Cambio de tamaño de imagen incorporado a una relación de aspecto fija No es necesario cambiar el tamaño manualmente
Actuación
Mayor cuota de solicitudes por minuto (RPM) en Amazon Bedrock Mayor rendimiento de tokens por minuto (TPM) Rentable para detección a gran escala
Arquitectura sin servidor: utilizamos AWS Lambda y Amazon Bedrock para mantener una solución rentable y escalable que no requería una gestión de infraestructura compleja ni alojamiento de modelos.
Comprensión contextual adicional: para mejorar la detección y reducir los falsos positivos, utilizamos Anthropic Claude Sonnet 4.0 para generar descripciones de texto para cada UIN y crear parámetros de detección.
Descripción general de la solución
La solución Intelligent Operational Readiness (IORA) incluye varios servicios clave y se describe en el diagrama de arquitectura que aparece a continuación:
API Gateway: Amazon API Gateway maneja las solicitudes de los usuarios y las rutas a las funciones Lambda apropiadas. Procesamiento de imágenes sincrónico: Amazon Bedrock Nova Pro analiza imágenes con tiempos de respuesta de 2 a 5 segundos. Seguimiento de progreso: el sistema rastrea el progreso de la detección de UIN (% de UIN detectados por módulo). Almacenamiento de datos: Amazon Simple Storage Service (S3) se utiliza para almacenar imágenes de módulos, imágenes de referencia de UIN y resultados. Amazon DynamoDB se utiliza para almacenar datos de verificación estructurados Computación: AWS Lambda se utiliza para análisis de imágenes y operaciones de datos Inferencia de modelo: Amazon Bedrock se utiliza para inferencia en tiempo real para la detección de objetos, así como para inferencia por lotes para la generación de descripciones
Descripción Tubería de Generación
El proceso de generación de descripciones es uno de los sistemas clave que trabajan en conjunto para automatizar el proceso de ORT. El primero es el proceso de generación de descripciones, que crea una base de conocimientos estandarizada para la identificación de componentes y se ejecuta como un proceso por lotes cuando se introducen nuevos módulos. Las imágenes tomadas en el centro logístico tienen diferentes condiciones de iluminación y ángulos de cámara, lo que puede afectar la capacidad del modelo para detectar consistentemente el componente correcto. Al utilizar imágenes de referencia de alta calidad, podemos generar descripciones estandarizadas para cada UIN. Luego generamos reglas de detección utilizando la BOM, que enumera los UIN requeridos en cada módulo, sus cantidades y especificaciones asociadas. Este proceso garantiza que cada UIN tenga una descripción estandarizada y reglas de detección adecuadas, creando una base sólida para los procesos posteriores de detección y evaluación.
El flujo de trabajo es el siguiente:
El administrador carga imágenes UIN y datos de BOM La función Lambda activa dos procesos paralelos: Ruta A: generación de descripciones de UIN Procesa las imágenes de referencia de cada UIN a través de Claude Sonnet 4.0 Genera descripciones de UIN detalladas Consolida múltiples descripciones en una descripción por UIN Almacena descripciones consolidadas en DynamoDB Ruta B: creación de reglas de detección Combina descripciones de UIN con datos de BOM Genera reglas de detección específicas del módulo Crea patrones de detección de falsos positivos Almacena reglas en DynamoDB
Patrones de detección de falsos positivos
Para mejorar la coherencia de la salida, optimizamos el mensaje agregando reglas adicionales para los falsos positivos comunes. Esto ayuda a filtrar objetos que no son relevantes para la detección. Por ejemplo, las señales triangulares deben tener un número de puerta y una flecha y las señales genéricas no deben detectarse.
Canal de evaluación de detección de UIN
Esta canalización maneja la verificación de componentes en tiempo real. Ingresamos las imágenes tomadas por el probador, las reglas de detección específicas del módulo y las descripciones de UIN en Nova Pro usando Amazon Bedrock. Las salidas son las UIN detectadas con cuadros delimitadores, junto con el estado de la instalación, la identificación de defectos y las puntuaciones de confianza.
La función Lambda procesa cada imagen de módulo utilizando la configuración seleccionada:
Canal de aplicaciones de un extremo a otro
La aplicación reúne todo y proporciona a los evaluadores en el centro logístico una interfaz de usuario lista para producción. También proporciona un análisis integral que incluye identificación UIN precisa, coordenadas del cuadro delimitador, verificación del estado de la instalación y detección de defectos con puntuación de confianza.
El flujo de trabajo, que se refleja en la interfaz de usuario, es el siguiente:
Un evaluador carga de forma segura las imágenes en Amazon S3 desde la interfaz, ya sea tomando una foto o cargándola manualmente. Las imágenes se cifran automáticamente en reposo en S3 mediante AWS Key Management Service (AWS KMS). Esto activa la verificación, que llama al punto final API para la verificación UIN. Las llamadas API entre servicios utilizan la autenticación basada en roles de AWS Identity and Access Management (IAM). Una función Lambda recupera las imágenes de S3. Amazon Nova Pro detecta los UIN necesarios de cada imagen. Los resultados de la detección de UIN se almacenan en DynamoDB con el cifrado habilitado.
La siguiente figura muestra la interfaz de usuario después de cargar y procesar una imagen. La información incluye el nombre de UIN, una descripción, cuándo se actualizó por última vez, etc.
La siguiente imagen es de un panel en la interfaz de usuario que el usuario puede usar para revisar los resultados y anular manualmente cualquier entrada si es necesario.
Resultados y aprendizajes
Después de construir el prototipo, probamos la solución en varios centros logísticos utilizando tabletas Kindle de Amazon. Logramos una precisión del 92 % en un conjunto representativo de módulos de prueba con una latencia de 2 a 5 segundos por imagen. En comparación con las pruebas manuales de preparación operativa, IORA reduce el tiempo total de prueba en un 60 %. Amazon Nova Pro también pudo identificar etiquetas faltantes en los datos reales, lo que nos brindó la oportunidad de mejorar la calidad del conjunto de datos.
"Los resultados de precisión se traducen directamente en ahorro de tiempo: una cobertura del 40 % equivale a una reducción del tiempo del 40 % para nuestros equipos de campo. Cuando la solución detecta un UIN, los equipos de nuestro centro logístico pueden centrarse con confianza solo en encontrar los componentes faltantes".
– Wayne Jones, director sénior de programas, servicios de ingeniería general de Amazon
Aprendizajes clave:
Amazon Nova Pro destaca en las tareas de reconocimiento visual cuando se le proporcionan descripciones contextuales ricas y supera la precisión al utilizar la comparación de imágenes independiente. La calidad de los datos reales afecta significativamente el rendimiento del modelo. La solución identificó etiquetas faltantes en el conjunto de datos original y ayuda a mejorar los datos etiquetados por humanos. Los módulos con menos de 20 UIN obtuvieron mejores resultados y vimos una degradación del rendimiento en los módulos con 40 o más UIN. Se necesita procesamiento jerárquico para módulos con más de 40 componentes. La arquitectura sin servidor que utiliza Lambda y Amazon Bedrock proporciona una escalabilidad rentable sin complejidad de infraestructura.
Conclusión
Esta publicación demuestra cómo utilizar Amazon Nova y Anthropic Claude Sonnet en Amazon Bedrock para crear una solución automatizada de reconocimiento de imágenes para pruebas de preparación operativa. Le mostramos cómo:
Procese y analice imágenes a escala utilizando los modelos de Amazon Nova Genere y enriquezca descripciones de componentes para mejorar la precisión de la detección Cree una canalización confiable para la verificación de componentes en tiempo real Almacene y administre resultados de manera eficiente utilizando servicios de almacenamiento administrados
Este enfoque se puede adaptar a casos de uso similares que requieren inspección y verificación visual automatizadas en diversas industrias, incluidas la fabricación, la logística y el control de calidad. En el futuro, planeamos mejorar las capacidades del sistema, realizar implementaciones piloto y explorar aplicaciones más amplias en todas las operaciones de Amazon.
Para obtener más información sobre Amazon Nova y otros modelos de cimentación en Amazon Bedrock, visite la página de documentación de Amazon Bedrock.
Acerca de los autores
Bishesh Adhikari es arquitecto senior de creación de prototipos de ML en AWS con más de una década de experiencia en ingeniería de software e IA/ML. Especializado en IA generativa, LLM, NLP, CV y GeoSpatial ML, colabora con clientes de AWS para crear soluciones para problemas desafiantes a través del desarrollo conjunto. Su experiencia acelera el recorrido de los clientes desde el concepto hasta la producción, abordando casos de uso complejos en diversas industrias. En su tiempo libre, le gusta hacer senderismo, viajar y pasar tiempo con familiares y amigos.
Hin Yee Liu es gerente senior de participación de GenAI en AWS. Lidera compromisos de creación de prototipos de IA en desafíos técnicos complejos, trabajando en estrecha colaboración con los clientes para ofrecer soluciones listas para producción que aprovechan las tecnologías de IA generativa, IA/ML, Big Data y sin servidor a través de metodologías ágiles. Fuera del trabajo, le gusta la cerámica, viajar y probar nuevos restaurantes en Londres.
Akhil Anand es director de programas en Amazon y le apasiona utilizar la tecnología y los datos para resolver problemas empresariales críticos e impulsar la innovación. Se centra en utilizar los datos como base central y la IA como una capa poderosa para acelerar el crecimiento empresarial. Akhil colabora estrechamente con los equipos de tecnología y negocios de Amazon para traducir ideas en soluciones escalables, facilitando un sólido enfoque centrado en el usuario y un rápido desarrollo de productos. Fuera del trabajo, Akhil disfruta del aprendizaje continuo, colaborando con amigos para crear nuevas soluciones y viendo la Fórmula 1.
Zakaria Fanna es ingeniero senior de creación de prototipos de IA en Amazon con más de 15 años de experiencia en diversos dominios de TI, incluidos redes, DevOps, automatización e IA/ML. Se especializa en el rápido desarrollo de Productos Mínimos Viables (MVP) para usuarios internos. A Zakaria le gusta abordar problemas técnicos desafiantes y ayudar a los clientes a escalar sus soluciones aprovechando tecnologías de vanguardia. En su tiempo libre, Zakaria disfruta del aprendizaje continuo, los deportes y valora el tiempo que pasa con sus hijos y su familia.
Elad Dwek es desarrollador senior de negocios de IA en Amazon y trabaja en ingeniería, mantenimiento y sostenibilidad globales. Se asocia con partes interesadas del sector empresarial y tecnológico para identificar oportunidades en las que la IA puede mejorar los desafíos empresariales o transformar completamente los procesos, impulsando la innovación desde la creación de prototipos hasta la producción. Con experiencia en construcción e ingeniería física, se enfoca en la gestión del cambio, la adopción de tecnología y la creación de soluciones escalables y transferibles que brinden una mejora continua en todas las industrias. Fuera del trabajo, le gusta viajar por el mundo con su familia.
Palash Choudhury es ingeniero de desarrollo de software en AWS Corporate FP&A con más de 10 años de experiencia en tecnologías frontend, backend y DevOps. Se especializa en el desarrollo de soluciones escalables para desafíos de asignación financiera corporativa y aprovecha activamente las tecnologías AI/ML para automatizar flujos de trabajo y resolver problemas comerciales complejos. Apasionado por la innovación, Palash disfruta experimentando con tecnologías emergentes para transformar los procesos comerciales tradicionales.