Swann proporciona IA generativa a millones de dispositivos IoT utilizando Amazon Bedrock

Si administra dispositivos de Internet de las cosas (IoT) a escala, la fatiga de alertas probablemente esté socavando la efectividad de su sistema. Esta publicación le muestra cómo implementar el filtrado de notificaciones inteligente utilizando Amazon Bedrock y sus capacidades de generación de inteligencia artificial. Aprenderá estrategias de selección de modelos, técnicas de optimización de costos y patrones arquitectónicos para implementar IA generacional a escala de IoT, basados ​​en la implementación de Swann Communications en millones de dispositivos.

Los clientes de seguridad inteligente para el hogar ahora esperan sistemas que puedan distinguir entre un repartidor y un posible intruso, no solo detectar movimiento. Los clientes se veían abrumados con muchas notificaciones diarias o falsos positivos, y muchas alertas se activaban por eventos que eran irrelevantes para los clientes, como autos que pasaban, mascotas moviéndose, etc. Los usuarios se frustraron con las constantes alertas falsas y comenzaron a ignorar las notificaciones por completo, incluidas las amenazas de seguridad reales.

Como pionero en soluciones de seguridad de bricolaje, Swann Communications ha creado una red global de más de 11,74 millones de dispositivos conectados, que presta servicios a propietarios de viviendas y empresas en varios continentes. Swann se asoció con Amazon Web Services (AWS) para desarrollar un sistema de notificación de IA generativa multimodelo para hacer evolucionar su sistema de notificación de un mecanismo de alerta reactivo básico a un asistente de seguridad inteligente y consciente del contexto.

Desafíos empresariales que impulsan la solución

Antes de implementar la nueva solución, Swann enfrentó varios desafíos críticos que requirieron un enfoque fundamentalmente diferente para las notificaciones de seguridad.

El sistema anterior de Swann tenía una detección básica que solo podía identificar eventos humanos o de mascotas sin conocimiento contextual (trataba a un repartidor de la misma manera que a un intruso potencial) y no ofrecía opciones de personalización para que los usuarios definieran lo que constituía una alerta significativa para sus necesidades de seguridad únicas. Estas limitaciones técnicas, agravadas por los desafíos de escalabilidad en la gestión de notificaciones de manera rentable en decenas de millones de dispositivos, dejaron en claro que las mejoras incrementales no serían suficientes: Swann necesitaba un enfoque fundamentalmente más inteligente.

Aproximadamente 20 notificaciones diarias por cámara (la mayoría de ellas irrelevantes) hicieron que los clientes pasaran por alto eventos de seguridad críticos, y muchos usuarios desactivaron las notificaciones durante los primeros meses. Esto redujo significativamente la efectividad del sistema, lo que demuestra la necesidad de un filtrado inteligente que solo entregue alertas significativas. En lugar de administrar múltiples proveedores e integraciones personalizadas, Swann utilizó diferentes servicios en la nube de AWS que funcionan juntos. Al utilizar los servicios integrados de AWS, el equipo de ingeniería de Swann pudo concentrarse en crear nuevas funciones de seguridad.

Por qué se eligieron AWS y Amazon Bedrock

Al evaluar a los socios de IA, Swann priorizó las capacidades de nivel empresarial que pudieran escalar de manera confiable. AWS se destacó por varias razones clave:

Capacidades de IA de nivel empresarial

Swann eligió AWS por su enfoque integral e integrado para implementar IA generativa a escala. Amazon Bedrock, un servicio totalmente administrado, brindó acceso a múltiples modelos básicos a través de una única API, manejando el aprovisionamiento de GPU, la implementación del modelo y el escalado automáticamente, de modo que Swann pudiera probar y comparar diferentes familias de modelos (como Claude y Nova) sin cambios de infraestructura mientras optimizaba la velocidad o la precisión en función de cada escenario, como la detección de rutina de gran volumen, la verificación de amenazas que requiere un análisis detallado, alertas urgentes y una evaluación de comportamiento compleja. Con aproximadamente 275 millones de inferencias mensuales, el modelo de precios de pago por uso de AWS y la capacidad de utilizar modelos rentables como Nova Lite para análisis de rutina dieron como resultado la optimización de costos. Los servicios de AWS brindaron inferencia de baja latencia en América del Norte, Europa y Asia-Pacífico, al mismo tiempo que brindaron cumplimiento de residencia de datos y alta disponibilidad para aplicaciones de seguridad de misión esencial.

El entorno de AWS utilizado por Swann incluía AWS IoT Core para la conectividad de dispositivos, Amazon Simple Storage Service (Amazon S3) para almacenamiento escalable y transmisiones de video, y AWS Lambda para ejecutar código en respuesta a eventos sin administrar servidores, escalando de cero a miles de ejecuciones y cobrando solo por el tiempo de cómputo utilizado. Amazon Cognito se utiliza para administrar la autenticación y autorización de usuarios con inicio de sesión seguro, autenticación multifactor, integración de identidad social y credenciales temporales de AWS. Amazon Simple Query Service (Amazon SQS) se utiliza para administrar la cola de mensajes, almacenar en búfer las solicitudes durante picos de tráfico y ayudar a garantizar un procesamiento confiable incluso cuando miles de cámaras se activan simultáneamente.

Al utilizar estas capacidades para eliminar el esfuerzo de administrar múltiples proveedores e integraciones personalizadas, Swann podría centrarse en la innovación en lugar de la infraestructura. Esta integración centrada en la nube aceleró el tiempo de comercialización en 2 meses y, al mismo tiempo, redujo los gastos operativos y permitió la implementación rentable de capacidades sofisticadas de IA en millones de dispositivos.

Requisitos de escalabilidad y rendimiento

La solución de Swann necesitaba manejar millones de dispositivos simultáneos (más de 11,74 millones de cámaras que generan fotogramas las 24 horas del día, los 7 días de la semana), patrones de carga de trabajo variables con actividad máxima durante las horas de la tarde y los fines de semana, procesamiento en tiempo real para proporcionar latencia inferior a un segundo para eventos de seguridad críticos, distribución global con rendimiento consistente en múltiples regiones geográficas y previsibilidad de costos a través de precios transparentes que escalan linealmente con el uso. Swann descubrió que los servicios de Amazon Bedrock y AWS les brindaban lo mejor de ambos mundos: una red global que podía manejar su escala masiva, además de controles de costos inteligentes que les permitían elegir exactamente el modelo correcto para cada situación.

Descripción general e implementación de la arquitectura de la solución

El sistema de notificaciones dinámicas de Swann utiliza Amazon Bedrock, utilizando estratégicamente cuatro modelos básicos (Nova Lite, Nova Pro, Claude Haiku y Claude Sonnet) en dos características clave para equilibrar el rendimiento, el costo y la precisión. Esta arquitectura, que se muestra en la siguiente figura, demuestra cómo se pueden combinar los servicios de AWS para crear una solución de análisis de video inteligente y escalable utilizando capacidades de IA generativa y al mismo tiempo optimizando el rendimiento y el costo:

Integración de dispositivos perimetrales: las cámaras y los timbres inteligentes se conectan a través de AWS IoT Device Gateway, lo que proporciona transmisiones de video en tiempo real para su análisis. Canalización de datos: el contenido de video fluye a través de Amazon EventBridge, Amazon S3 y Amazon SQS para un almacenamiento confiable y colas de mensajes. Procesamiento inteligente de cuadros: las instancias de Amazon Elastic Compute Cloud (Amazon EC2) (familias G3 y G4) utilizan bibliotecas de visión por computadora para segmentar videos en cuadros y manejar la selección y el filtrado de cuadros para optimizar la eficiencia del procesamiento. Las instancias G3 y G4 son servidores virtuales con GPU diseñados para cargas de trabajo de procesamiento paralelo, como análisis de video e inferencia de IA. A diferencia de las CPU tradicionales que procesan tareas de forma secuencial, las GPU contienen miles de núcleos que pueden analizar múltiples fotogramas de vídeo simultáneamente. Esto significa que Swann puede procesar fotogramas de miles de cámaras simultáneamente sin cuellos de botella de latencia, proporcionando monitoreo de seguridad casi en tiempo real. Procesamiento sin servidor: las funciones Lambda invocan Amazon Bedrock e implementan una lógica de selección de modelos basada en los requisitos del caso de uso. Estrategia de modelo escalonado: un enfoque rentable que utiliza múltiples modelos con diferentes capacidades. Amazon Nova Lite para velocidad y rentabilidad en detección rutinaria de gran volumen, Nova Pro para rendimiento equilibrado en verificación de amenazas, Claude Haiku para latencia ultrabaja en alertas en las que el tiempo es crítico y Claude Sonnet para razonamiento avanzado en análisis de comportamiento complejos que requieren un razonamiento matizado. Notificaciones dinámicas: el servicio de notificaciones personalizado ofrece alertas en tiempo real a aplicaciones móviles según los resultados de la detección.

Mejores prácticas para la implementación de IA generativa

Las siguientes mejores prácticas pueden ayudar a las organizaciones a optimizar los costos, el rendimiento y la precisión al implementar soluciones de IA generativa similares a escala:

Comprensión de los límites de RPM y tokens: los límites de solicitudes por minuto (RPM) definen la cantidad de llamadas API permitidas por minuto, lo que requiere que las aplicaciones implementen lógica de cola o reintento para manejar cargas de trabajo de gran volumen. Los tokens son las unidades básicas que utilizan los modelos de IA para procesar texto e imágenes con costos calculados por cada mil tokens, lo que hace que las indicaciones concisas sean esenciales para reducir los gastos a escala. Optimización de la lógica empresarial: Swann redujo las llamadas API en un 88 % (de 17 000 a 2000 RPM) mediante la implementación de un filtrado previo inteligente (detección de movimiento, análisis basado en zonas y eliminación de fotogramas duplicados) antes de invocar modelos de IA. Ingeniería rápida y optimización de tokens: Swann logró una reducción de tokens del 88 % (de 150 a 18 tokens por solicitud) a través de tres estrategias clave: optimizar la resolución de la imagen para reducir los tokens de entrada y al mismo tiempo preservar la calidad visual. Implementar un modelo de filtrado previo personalizado en instancias EC2 basadas en GPU para eliminar el 65 % de las detecciones falsas (ramas que se balancean, autos que pasan) antes de llegar a Amazon Bedrock. Ingeniería de mensajes ultraconcisos con formatos de respuesta estructurados que reemplazaron el lenguaje natural detallado con pares clave-valor analizables por máquina (por ejemplo, amenaza:BAJO|tipo:persona|acción:entrega). Las encuestas a los clientes de Swann revelaron que estas optimizaciones no solo redujeron la latencia y el costo, sino que también mejoraron la precisión de la detección de amenazas del 89% al 95%. Versiones, optimización y pruebas rápidas: Swann versionó avisos con metadatos de rendimiento (precisión, costo y latencia) y realizó pruebas A/B en entre el 5 % y el 10 % del tráfico antes del lanzamiento. Swann también utiliza la optimización rápida de Amazon Bedrock. Selección de modelos y estrategia por niveles: Swann seleccionó modelos según el tipo de actividad. Nova Lite (87% de las solicitudes): maneja la detección rápida de actividades de rutina, como autos que pasan, mascotas y personal de entrega. Su bajo costo, alto rendimiento y latencia inferior a milisegundos lo hacen esencial para análisis de gran volumen en tiempo real donde la velocidad y la eficiencia importan más que la precisión. Nova Pro (8% de las solicitudes): escala desde Nova Lite cuando amenazas potenciales requieren verificación con mayor precisión. Distingue al personal de entrega de los intrusos e identifica patrones de comportamiento sospechosos. Claude Haiku (2% de las solicitudes): potencia la función Notificarme cuando para notificación inmediata de criterios definidos por el usuario. Proporciona una latencia ultrabaja para alertas personalizadas urgentes. Claude Sonnet (3% de las solicitudes): Maneja casos extremos complejos que requieren un razonamiento sofisticado. Analiza interacciones entre varias personas, escenarios ambiguos y proporciona una evaluación del comportamiento matizada. Resultados: Este enrutamiento inteligente logra una precisión general del 95 % y, al mismo tiempo, reduce los costos en un 99,7 % en comparación con el uso de Claude Sonnet para todas las solicitudes, desde $ 2,1 millones a $ 6 mil mensuales proyectados. La idea clave fue que hacer coincidir las capacidades del modelo con la complejidad de las tareas permite una implementación rentable de IA generativa a escala, con un filtrado previo de la lógica empresarial y una selección de modelos por niveles que ofrecen ahorros mucho mayores que la elección del modelo por sí sola. Estrategia de destilación de modelos: Swann enseñó modelos de IA más pequeños y rápidos para imitar la inteligencia de los más grandes, como crear una versión liviana que es casi tan inteligente pero que funciona mucho más rápido y cuesta menos que los modelos grandes. En busca de nuevas funciones, Swann está explorando técnicas de destilación del modelo Nova. Permite la transferencia de conocimientos de modelos avanzados más grandes a modelos más pequeños y eficientes. También ayuda a optimizar el rendimiento del modelo para casos de uso particulares sin requerir datos de entrenamiento etiquetados extensos. Implemente un monitoreo integral: utilice Amazon CloudWatch para realizar un seguimiento de métricas de rendimiento críticas, incluidos los percentiles de latencia: p50 (tiempo de respuesta medio), p95 (percentil 95, captura del peor de los casos para la mayoría de los usuarios) y p99 (percentil 99, identificación de valores atípicos y estrés del sistema), junto con el consumo de tokens, el costo por inferencia, las tasas de precisión y los eventos de limitación. Estas métricas percentiles son cruciales porque la latencia promedio puede enmascarar problemas de rendimiento; por ejemplo, un promedio de 200 ms podría ocultar que el 5 % de las solicitudes tardan más de 2 segundos, lo que impacta directamente en la experiencia del cliente.

Conclusión

Después de implementar Amazon Bedrock, Swann observó mejoras inmediatas: los clientes recibieron menos alertas pero más relevantes. El volumen de alertas cayó un 25 %, mientras que la relevancia de las notificaciones aumentó un 89 % y la satisfacción del cliente aumentó un 3 %. El sistema se adapta a 11,74 millones de dispositivos con una latencia p95 inferior a 300 ms, lo que demuestra que las capacidades sofisticadas de IA generativa se pueden implementar de manera rentable en productos de IoT de consumo. Las notificaciones dinámicas (que se muestran en la siguiente imagen) brindan alertas de seguridad contextuales.

Una persona sosteniendo una caja.

La función Notificarme cuando (que se muestra en el siguiente vídeo) demuestra una personalización inteligente. Los usuarios definen lo que les importa utilizando un lenguaje natural, como "avisarme si un perro entra al patio trasero" o "avisarme si hay un niño cerca de la piscina", lo que permite un control de seguridad verdaderamente personalizado.

Próximos pasos

Las organizaciones que estén considerando la IA generativa a escala deben comenzar con un problema comercial claro y mensurable y realizar una prueba piloto con un subconjunto de dispositivos antes de la implementación completa, optimizando el costo desde el primer día a través de una lógica comercial inteligente y una selección de modelos escalonados. Invierta en un monitoreo integral para permitir una optimización continua y una arquitectura de diseño para una degradación elegante para verificar la confiabilidad incluso durante las interrupciones del servicio. Concéntrese en la ingeniería rápida y la optimización de tokens desde el principio para ayudar a lograr mejoras de rendimiento y costos. Utilice servicios administrados como Amazon Bedrock para manejar la complejidad de la infraestructura y crear una arquitectura flexible que admita futuras mejoras del modelo y capacidades de IA en evolución.

Explora recursos adicionales

Sobre los autores

Aman Sharma es arquitecto de soluciones empresariales en AWS, donde trabaja con clientes empresariales minoristas y de la cadena de suministro en toda ANZ. Con más de 21 años de experiencia en consultoría, arquitectura y diseño de soluciones, apasionado por democratizar la IA y el ML, ayudando a los clientes a diseñar datos y estrategias de ML. Fuera del trabajo, le gusta explorar la fotografía de naturaleza y vida silvestre.

Surjit Reghunathan es director de tecnología de Swann Communications, donde lidera la innovación tecnológica y la dirección estratégica de la plataforma global de seguridad IoT de la empresa. Con experiencia en la ampliación de soluciones de dispositivos conectados, Surjit impulsa la integración de capacidades de inteligencia artificial y aprendizaje automático en toda la cartera de productos de Swann. Fuera del trabajo, le gustan los largos paseos en motocicleta y tocar la guitarra.

Suraj Padinjarute es gerente técnico de cuentas en AWS y ayuda a los clientes minoristas y de la cadena de suministro a maximizar el valor de sus inversiones en la nube. Con más de 20 años de experiencia en TI en administración de bases de datos, soporte de aplicaciones y transformación de la nube, le apasiona ayudar a los clientes en su viaje a la nube. Fuera del trabajo, a Suraj le gusta montar en bicicleta largas distancias y explorar el aire libre.