Esta publicación está coescrita por TrueLook y AWS.
TrueLook es una empresa de cámaras de construcción e inteligencia en el lugar de trabajo que brinda visibilidad en tiempo real de los proyectos de construcción. Su plataforma combina cámaras de lapso de tiempo de alta resolución, transmisión de video en vivo e información basada en inteligencia artificial para ayudar a los equipos a monitorear el progreso, mejorar la responsabilidad y reducir el riesgo durante todo el ciclo de vida del proyecto.
TrueLook utilizó Amazon SageMaker AI para construir e implementar un sistema de monitoreo de seguridad de la construcción impulsado por AI que detecta automáticamente equipos de protección personal (EPP) combinando la experiencia de TrueLook en sistemas de cámaras en el lugar de trabajo utilizando la infraestructura de aprendizaje automático (ML) de AWS. TrueLook ha creado una solución que identifica problemas de seguridad mediante análisis de imágenes automatizados para identificar EPI, como cascos, chalecos de seguridad de alta visibilidad, cascos de seguridad, guantes, gafas protectoras y mucho más. A través de este sistema, los equipos de proyecto pueden descubrir condiciones de trabajo inseguras, comportamientos de incumplimiento y exposición a zonas de alto riesgo más rápidamente, fortaleciendo la gobernanza general de la seguridad. La IA está ayudando a TrueLook a pasar de las comprobaciones manuales a un enfoque más inteligente y escalable para la seguridad en el lugar de trabajo.
Esta publicación proporciona una descripción arquitectónica detallada de cómo TrueLook construyó su sistema de monitoreo de seguridad impulsado por IA utilizando SageMaker AI, destacando decisiones técnicas clave, patrones de diseño de tuberías y las mejores prácticas de MLOps. Obtendrá información valiosa sobre el diseño de soluciones de visión por computadora escalables en AWS, particularmente en torno a flujos de trabajo de capacitación de modelos, creación automatizada de canalizaciones y estrategias de implementación de producción para inferencia en tiempo real.
Seguridad en la construcción: el desafío crítico
Los sitios de construcción se encuentran entre los entornos laborales más peligrosos, y los trabajadores enfrentan riesgos debido a maquinaria pesada, áreas de trabajo elevadas, peligros eléctricos y exposiciones químicas. La Administración de Salud y Seguridad Ocupacional (OSHA) informa que la construcción representa una de cada cinco muertes de trabajadores en los EE. UU. cada año, a pesar de representar una proporción significativamente menor de la fuerza laboral total. Más allá del costo humano, los incidentes de seguridad crean cargas financieras significativas a través de reclamos de compensación laboral, retrasos en proyectos, multas regulatorias y posibles litigios.
El monitoreo de seguridad tradicional depende en gran medida de la supervisión manual en la que los gerentes de seguridad realizan recorridos periódicos por el lugar, revisan las imágenes después de que ocurren incidentes o dependen de que los trabajadores informen ellos mismos sobre las violaciones. Sin embargo, este enfoque enfrenta limitaciones fundamentales:
Restricciones de escala: los grandes proyectos de construcción con múltiples sitios y cientos de trabajadores no pueden ser monitoreados de manera efectiva solo por observadores humanos. Cobertura inconsistente: el monitoreo manual está sujeto a fatiga, distracción y errores humanos, lo que lleva a infracciones omitidas durante los momentos críticos. Respuesta reactiva: los métodos tradicionales a menudo identifican problemas de seguridad solo después de que han ocurrido incidentes, lo que limita las oportunidades de prevención. Intensivo en recursos: implementar suficientes monitores humanos en todos los sitios y turnos requiere una importante inversión de personal. OSHA y otros organismos reguladores
Estos desafíos crean la necesidad de soluciones de monitoreo de seguridad automatizadas y escalables que puedan proporcionar una supervisión consistente y en tiempo real de todas las operaciones de construcción.
Descripción general de la solución
La solución de detección y monitoreo de PPE basada en IA de TrueLook utiliza la infraestructura de AWS y ML para detectar problemas de cumplimiento de seguridad en zonas de construcción a través de imágenes del sitio. TrueLook obtiene imágenes para usar en la detección de PPE desde cámaras en el sitio. Para crear, entrenar e implementar estos modelos, TrueLook utiliza SageMaker AI, que proporciona una infraestructura administrada para todo el flujo de trabajo de ML. Al descargar el trabajo pesado indiferenciado de la configuración y orquestación de la infraestructura a SageMaker AI, el equipo de TrueLook puede centrarse en mejorar la precisión y confiabilidad del modelo, ayudando a garantizar que la solución se amplíe de manera efectiva en los sitios de los clientes. El siguiente diagrama de arquitectura ilustra el flujo de trabajo de un extremo a otro y destaca cómo se integran múltiples servicios de AWS para ofrecer una solución de IA escalable y sin interrupciones.
El conjunto de datos de imágenes etiquetadas de TrueLook avanza a través de un proceso de capacitación en tres etapas clave: preprocesamiento (SageMaker Processing Job), capacitación (SageMaker Training Job) y control de versiones con observabilidad (SageMaker Model Registry). Los trabajos de procesamiento de SageMaker manejaron la limpieza y preparación de imágenes a escala, ejecutándose en uno o varios nodos según el tamaño del conjunto de datos. Los trabajos de capacitación de SageMaker ejecutaron la capacitación del modelo utilizando contenedores PyTorch integrados y GPU NVIDIA. Con una configuración de tiempo de ejecución básica con estimadores de SageMaker PyTorch, el mismo script podría ejecutarse en una configuración de múltiples GPU de un solo nodo o ampliarse a un entrenamiento distribuido de múltiples nodos, de modo que TrueLook pudiera equilibrar la velocidad y la precisión según sea necesario. Luego, los modelos entrenados se versionaron y almacenaron en el Registro de modelos de SageMaker, lo que proporciona un centro central para el seguimiento, la gobernanza y la implementación.
Como se indica en el diagrama de arquitectura anterior, este flujo de trabajo está orquestado de un extremo a otro con SageMaker Pipelines, que une el preprocesamiento, la capacitación y el registro en un flujo automatizado y repetible. Al utilizar la integración administrada de MLflow y la funcionalidad TensorBoard ofrecida por SageMaker, TrueLook podría rastrear experimentos, comparar el rendimiento y proporcionar repetibilidad a escala, lo que simplifica el ajuste de los modelos y ofrece una detección precisa de PPE en las obras de construcción de sus clientes en todo el país.
Una vez que los modelos se entrenan, evalúan y aprueban, la implementación se realiza a través del servicio de alojamiento totalmente administrado disponible a través de SageMaker AI. Los puntos finales en tiempo real ofrecen inferencia de baja latencia a escala, lo que permite la detección de PPE directamente en secuencias de video en vivo o instantáneas. Cuando se detecta una infracción, el sistema activa alertas posteriores que notifican a los clientes en tiempo real. Para que el sistema siga mejorando continuamente, TrueLook amplía este proceso con un ciclo de aprendizaje activo. Al colocar nuevos lotes de imágenes en Amazon Simple Storage Service (Amazon S3), el flujo de trabajo activa automáticamente el ajuste o el reentrenamiento a través de un proceso de integración y entrega continua (CI/CD). Antes de la promoción a producción, cada modelo candidato pasa por comprobaciones de gobernanza en el Registro de modelos de SageMaker, evaluación del tiempo de ejecución con MLflow y validación de inferencia visual con Tensorboard. Solo después de completar estos pasos se implementan nuevos modelos, lo que ayuda a garantizar la confiabilidad y la coherencia a escala.
Cree modelos de detección de objetos de visión por computadora de alto rendimiento con SageMaker AI
La formación de modelos precisos de visión por computadora comienza con datos anotados de alta calidad, un paso que a menudo se convierte en un cuello de botella en el desarrollo de servicios basados en IA. Para TrueLook, crear un modelo de detección de PPE confiable significa crear un conjunto de datos etiquetados que capture todas las clases principales de infracciones (personas, cascos, chalecos de seguridad, botas de seguridad y más) en diversas condiciones, como diferentes escenas, iluminación, orientaciones y perspectivas. Estas anotaciones provienen de la red nacional de transmisiones de cámaras de video de TrueLook en los sitios de construcción. Para acelerar el progreso y mejorar la calidad del modelo, el equipo de ingeniería de TrueLook se asoció con el equipo de ciencia de datos de comercialización (GTM) de SageMaker AI para diseñar un proceso de capacitación de múltiples etapas de alta precisión. Este enfoque redujo el tiempo necesario para pasar de la experimentación a la producción al combinar la profunda visión por computadora y la experiencia en ciencia de datos de AWS y TrueLook con los flujos de trabajo de implementación y capacitación administrados y simplificados respaldados por SageMaker AI. El resultado fue un proceso escalable de varias etapas que permitió una iteración más rápida, una complejidad operativa simplificada y proporcionó mejoras de precisión más allá de los modelos de detección de PPE de última generación anteriores de TrueLook.
Experimentos tempranos y enfoques alternativos
TrueLook comenzó experimentando con otros proveedores que ofrecían flujos de trabajo impulsados por UI o API para capacitación de modelos de aprendizaje profundo (DL) y aprendizaje automático sin código y con poco código. TrueLook inicialmente utilizó hiperparámetros predeterminados recomendados por los proveedores y posteriormente volvió a entrenar los modelos después de ajustar los parámetros expuestos, como el tamaño del lote, la tasa de aprendizaje y los umbrales de confianza, para ajustar y evaluar rápidamente los modelos de detección de objetos utilizando sus propios conjuntos de datos. Sin embargo, el control limitado sobre el proceso de capacitación no produjo resultados suficientes para la preparación para la producción, porque el rendimiento del modelo se estancó dentro de un rango estrecho debido a la falta de controles adicionales de ajuste y optimización. Por ejemplo, el entrenamiento con un conjunto inicial de 1000 imágenes etiquetadas produjo una precisión promedio promedio (mAP) en el rango del 60 al 70%. Si bien esto demostró la viabilidad del enfoque, los resultados también mostraron que el rendimiento aumentó estrechamente con la cantidad de imágenes etiquetadas disponibles, lo que destaca la necesidad de una canalización más avanzada y escalable.
Un proceso de ajuste fino de tres etapas utilizando SageMaker AI
Los primeros experimentos con enfoques de código bajo y sin código revelaron la necesidad de cambiar de dominio un modelo de detección de objetos de dominio abierto previamente entrenado (originalmente entrenado para reconocer objetos genéricos como vehículos, personas y animales) al dominio de la construcción y la seguridad. Esta adaptación inicial del dominio permite que el modelo aprenda conceptos visuales específicos de la construcción, incluido el equipo de seguridad y la presencia de los trabajadores en condiciones complejas del lugar de trabajo, como la oclusión parcial, utilizando conjuntos de datos de construcción seleccionados de código abierto. Este modelo de detección de objetos de dominio cambiado luego se afina aún más en conjuntos de datos específicos del cliente para alinear las clases de objetivos del modelo con los estándares de etiquetado y las condiciones del sitio de cada cliente. El siguiente diagrama ilustra esta progresión como un flujo de trabajo de capacitación de tres etapas.
Modelo previamente entrenado: seleccione un modelo de detección de objetos de visión por computadora (CV) previamente entrenado y entrenado en imágenes de código abierto a gran escala. Adaptación del dominio: ajuste un modelo previamente entrenado con un conjunto de datos de dominio de seguridad de la construcción disponible abiertamente. Ajuste fino: ajuste el modelo adaptado al dominio en el conjunto de datos anotado de TrueLook para mejorar rápidamente la precisión.
Familia de modelos de detección de objetos YOLO
Antes de examinar el flujo de trabajo de capacitación de varias etapas, queremos presentar el modelo de detección de objetos en el corazón del sistema de seguridad de la construcción impulsado por IA de TrueLook.
YOLO (You Only Look Once) es una familia de modelos de detección de objetos en tiempo real optimizados para una detección rápida en una sola pasada con un sólido equilibrio entre precisión y rendimiento, lo que lo hace ideal para entornos dinámicos como los lugares de trabajo de construcción. YOLOv11 avanza en este linaje con mejoras arquitectónicas que mejoran la extracción de características, ofrecen mayor precisión con menos parámetros y permiten una inferencia más rápida, incluso en hardware restringido, al mismo tiempo que admiten tareas como segmentación y estimación de pose.
Flujo de trabajo de ajuste fino de detección de objetos en múltiples etapas
En esta sección, describimos el enfoque integral utilizado para seleccionar, adaptar y ajustar un modelo de visión previamente entrenado para el monitoreo de la seguridad en el sitio de construcción.
Selección de un modelo previamente entrenado: el equipo evaluó modelos previamente entrenados en función de factores como el tamaño, la precisión, las métricas de entrenamiento, la cobertura de clases y las licencias. Se seleccionó YOLOv11 como modelo base por su sólido rendimiento y su idoneidad para casos de uso relacionados con la construcción. Adaptación al dominio: los modelos previamente entrenados a menudo se entrenan en clases amplias, como automóviles, animales u objetos cotidianos. Al adaptar estos pesos para centrarse en clases específicas de la construcción, como cascos, conos de seguridad y trabajadores en zonas de seguridad, el modelo ganó conciencia de dominio. Esta adaptación utilizó conjuntos de datos disponibles abiertamente como Roboflow: Construction Safety y se benefició del aumento de datos para mejorar la solidez en perspectivas, oclusiones y condiciones de iluminación. Ajuste con datos de TrueLook: el modelo adaptado al dominio luego se ajustó en el conjunto de datos etiquetados de alta calidad patentado de TrueLook. Debido a que el modelo ya reconocía las clases de PPE razonablemente bien después de la segunda etapa, el ajuste fino mejoró su rendimiento en las imágenes de las transmisiones de construcción en vivo de TrueLook. Los aumentos adicionales del tiempo de entrenamiento mejoraron aún más la generalización en condiciones del mundo real.
Este enfoque por etapas resultó muy eficaz. Por ejemplo, con las mismas 1000 imágenes etiquetadas, el canal logró puntuaciones mAP en el rango del 80% al 90%, una mejora de 20 puntos con respecto al flujo de trabajo del proveedor alternativo. Otro beneficio de este diseño fue la eficiencia: las etapas uno y dos debían ejecutarse solo una vez, lo que producía un modelo reutilizable adaptado al dominio. Cada vez que había nuevos datos disponibles, TrueLook podía volver a ejecutar la etapa tres, reduciendo el tiempo de entrenamiento y mejorando continuamente la precisión general del modelo. Por el contrario, las alternativas de código bajo y sin código generalmente ofrecen un control limitado sobre la arquitectura del modelo, la estrategia de entrenamiento y la optimización de múltiples etapas, lo que dificulta la adaptación explícita del dominio y el ajuste iterativo a escala. Si bien estas herramientas pueden acelerar la creación de prototipos iniciales, a menudo se quedan cortas cuando se requiere mayor precisión, reproducibilidad y personalización de grado de producción para entornos complejos del mundo real, como los lugares de trabajo de construcción.
Operacionalización con SageMaker AI
Al utilizar SageMaker AI, TrueLook puso en funcionamiento su flujo de trabajo de detección de objetos de varias etapas como un marco MLOps escalable y listo para producción. Al utilizar capacidades administradas como SageMaker Pipelines y SageMaker Model Registry, TrueLook automatizó el ciclo de vida completo del modelo, desde la capacitación y la evaluación hasta el control de versiones y la implementación, manteniendo al mismo tiempo una sólida gobernanza y trazabilidad. Este enfoque redujo la orquestación manual, redujo el riesgo operativo y proporcionó la confiabilidad y observabilidad necesarias para ejecutar servicios de monitoreo de seguridad impulsados por IA a escala.
Implementación de la detección de objetos de un extremo a otro utilizando SageMaker Pipelines
La creación de un modelo preciso de detección de objetos fue solo el primer paso para crear un sistema integral de seguridad en la construcción impulsado por IA. La mejora continua requirió iteración rápida, experimentación controlada y promoción confiable de modelos de alta calidad a medida que se disponía de nuevos datos. Para permitir esto, TrueLook y AWS implementaron un flujo de trabajo automatizado utilizando SageMaker Pipelines que admite la experimentación paralela con la capacidad de agregar una evaluación de modelo automatizada que filtra automáticamente los modelos de bajo rendimiento y avanza solo aquellos que cumplen con los umbrales de rendimiento predefinidos, lo que resulta en una iteración más rápida, una reproducibilidad mejorada y un camino confiable desde la experimentación hasta la producción.
Creando el pipeline – Definir una vez la filosofía
TrueLook implementó un flujo de trabajo parametrizado y reutilizable que automatiza el ciclo de vida completo de sus modelos de detección de objetos de seguridad en la construcción. El flujo de trabajo comienza transformando imágenes sin procesar del lugar de trabajo en conjuntos de datos listos para modelar. Luego entrena un modelo de detección de objetos YOLOv11 y registra automáticamente el modelo entrenado en un registro de modelo central para control de versiones y gobernanza. Los pasos de evaluación integrados miden el rendimiento del modelo (como mAP, puntuación F1, etc.) frente a umbrales predefinidos. Los modelos que cumplen con estos estándares se promocionan para su implementación y se registran como artefactos versionados en un registro de modelos central. Estos modelos registrados se pueden revisar, comentar, aprobar o rechazar mediante flujos de trabajo auditables, mientras que las ejecuciones de bajo rendimiento se detienen automáticamente para evitar que los modelos de baja calidad lleguen a producción.
TrueLook definió un flujo de trabajo parametrizado y reutilizable que reduce la necesidad de reconstruir la lógica de orquestación para cada iteración del modelo. Los equipos pueden activar ejecuciones repetibles ajustando los conjuntos de datos y las configuraciones de entrenamiento, como la resolución de la imagen, el tamaño del lote, las tasas de aprendizaje, la duración del entrenamiento y las estrategias de aumento de datos. También pueden ajustar las configuraciones informáticas, incluido el tipo de instancia de GPU, la cantidad de GPU y la capacidad de memoria. Se pueden ejecutar varias ejecuciones en paralelo, mientras que la activación automatizada y la ejecución condicional imponen estándares de calidad consistentes, lo que reduce la sobrecarga operativa, minimiza el error humano y acelera la mejora continua del modelo a escala.
Experimentación gobernada e implementación automatizada
Cada ejecución de entrenamiento se rastrea automáticamente a través de sistemas integrados de gestión de experimentos y registro de modelos que capturan parámetros, métricas y artefactos del modelo en historiales versionados. Esto crea un catálogo de resultados experimentales con capacidad de búsqueda, lo que permite la comparación sistemática de diferentes estrategias de capacitación y la identificación de configuraciones óptimas para la detección de seguridad en la construcción. Luego, los modelos aprobados se implementan automáticamente en puntos finales de producción acelerados por GPU utilizando nombres versionados y con marca de tiempo para evitar conflictos. Esto crea un camino fluido y repetible desde la experimentación hasta la implementación en tiempo real, lo que permite una iteración rápida mientras se mantiene una gobernanza sólida y una intervención manual mínima.
Resumen
Este estudio de caso destaca cómo la colaboración entre AWS y TrueLook permitió a los equipos de construcción utilizar servicios de aprendizaje automático administrados para un monitoreo de seguridad escalable y listo para producción, evitando al mismo tiempo una gran sobrecarga de infraestructura. Demuestra un enfoque probado de ajuste fino de tres etapas que ofrece modelos de seguridad de construcción de alta precisión incluso con datos limitados, superando lo que normalmente se puede lograr con alternativas de código bajo o sin código. Esta publicación también proporciona orientación práctica sobre la creación, capacitación e implementación de modelos de visión por computadora utilizando los servicios administrados de AWS y enfatiza el valor de la participación temprana de AWS para el diseño de arquitectura y la implementación de dominios específicos. El éxito de TrueLook ilustra cómo las soluciones de IA/ML centradas en la industria, respaldadas por una profunda experiencia en el campo, pueden automatizar y mejorar eficazmente las operaciones de seguridad en el lugar de trabajo.
Sobre los autores
Steven McDowall es un líder de tecnología y productos con amplia experiencia en estrategia de productos, gestión de productos e ingeniería de software. Actualmente se desempeña como vicepresidente de Producto en TrueLook, donde lidera el desarrollo de tecnología de construcción y soluciones de video en tiempo real, aportando una sólida base de ingeniería y un enfoque centrado en el usuario para la ejecución del producto.
Scott Anderson es el Director de Ingeniería de Plataforma en TrueLook, donde dirige el desarrollo y la escalabilidad de los sistemas que impulsan la plataforma central de la empresa. Aporta más de 30 años de profunda experiencia técnica y una mentalidad de ingeniería pragmática, centrándose en la construcción de una infraestructura confiable y mantenible que respalde el crecimiento de productos a largo plazo.
Marc Ritter es ingeniero de software líder en TrueLook, donde impulsa el diseño y la implementación de funciones centrales de la plataforma y contribuye a iniciativas de tecnología avanzada. Aplica una sólida mentalidad de ingeniería para resolver desafíos técnicos complejos y mejorar el rendimiento y la confiabilidad de las soluciones de TrueLook. A Marc le apasiona aprovechar la arquitectura bien pensada y el desarrollo colaborativo para crear sistemas de software escalables.
Pranav Murthy es científico senior de datos de IA generativa en AWS y se especializa en ayudar a las organizaciones a innovar con IA generativa, aprendizaje profundo y aprendizaje automático en Amazon SageMaker AI. Durante los últimos 10 años, ha desarrollado y ampliado modelos avanzados de visión por computadora (CV) y procesamiento de lenguaje natural (NLP) para abordar problemas de alto impacto, desde la optimización de las cadenas de suministro globales hasta permitir el análisis de video en tiempo real y la búsqueda multilingüe. Cuando no está creando soluciones de IA, Pranav disfruta jugando juegos estratégicos como el ajedrez, viajando para descubrir nuevas culturas y asesorando a aspirantes a profesionales de la IA. Puedes encontrar Pranav en LinkedIn.
Gaurav Singh es gerente senior de soluciones para clientes en AWS con más de 20 años de experiencia en transformación de la nube y consultoría de TI. Se especializa en guiar a los clientes a lo largo de su viaje a la nube, sirviendo como asesor confiable para oportunidades de migración, modernización e innovación. Gaurav brinda orientación de crecimiento estratégico que ayuda a los clientes a alcanzar sus objetivos mientras aprovechan los servicios de AWS para impulsar la innovación y la excelencia operativa. Puedes encontrar a Gaurav en LinkedIn.
Surya Kari es científico senior de datos de IA generativa en AWS y se especializa en el desarrollo de soluciones que aprovechan modelos básicos de última generación. Tiene una amplia experiencia trabajando con modelos de lenguaje avanzados, incluidos DeepSeek-R1, la familia Llama y Qwen, centrándose en su ajuste y optimización para aplicaciones científicas específicas. Su experiencia se extiende a la implementación de canales de capacitación eficientes y estrategias de implementación utilizando AWS SageMaker, lo que permite escalar modelos básicos desde el desarrollo hasta la producción. Colabora con los clientes para diseñar e implementar soluciones de IA generativa, ayudándolos a navegar por la selección de modelos, afinar enfoques y estrategias de implementación para lograr un rendimiento óptimo para sus casos de uso específicos. Puedes encontrar a Surya en LinkedIn.