Cómo desbloquear información de vídeo a escala con los modelos multimodales de Amazon Bedrock

El contenido de vídeo está ahora en todas partes, desde la vigilancia de seguridad y la producción de medios hasta las plataformas sociales y las comunicaciones empresariales. Sin embargo, extraer información significativa de grandes volúmenes de vídeo sigue siendo un gran desafío. Las organizaciones necesitan soluciones que puedan comprender no sólo lo que aparece en un vídeo, sino también el contexto, la narrativa y el significado subyacente del contenido.

En esta publicación, exploramos cómo los modelos de base multimodal (FM) de Amazon Bedrock permiten la comprensión de video escalable a través de tres enfoques arquitectónicos distintos. Cada enfoque está diseñado para diferentes casos de uso y compensaciones entre costo y rendimiento. La solución completa está disponible como muestra de AWS de código abierto en GitHub.

La evolución del videoanálisis

Los enfoques tradicionales de análisis de vídeo se basan en la revisión manual o en técnicas básicas de visión por computadora que detectan patrones predefinidos. Si bien son funcionales, estos métodos enfrentan limitaciones importantes:

Restricciones de escala: la revisión manual requiere mucho tiempo y es costosa Flexibilidad limitada: los sistemas basados ​​en reglas no pueden adaptarse a nuevos escenarios Ceguera al contexto: el CV tradicional carece de comprensión semántica Complejidad de integración: difícil de incorporar en aplicaciones modernas

La aparición de modelos de cimentación multimodal en Amazon Bedrock cambia este paradigma. Estos modelos pueden procesar información visual y textual juntas. Esto les permite comprender escenas, generar descripciones en lenguaje natural, responder preguntas sobre contenido de video y detectar eventos matizados que serían difíciles de definir mediante programación.

Tres enfoques para la comprensión del vídeo

Comprender el contenido de vídeo es intrínsecamente complejo y combina información visual, auditiva y temporal que debe analizarse en conjunto para obtener información significativa. Los diferentes casos de uso, como el análisis de escenas de medios, la detección de pausas publicitarias, el seguimiento de cámaras IP o la moderación de redes sociales, requieren flujos de trabajo distintos con diferentes compensaciones de costo, precisión y latencia. Esta solución proporciona tres flujos de trabajo distintos, cada uno de los cuales utiliza diferentes métodos de extracción de video optimizados para escenarios específicos.

Flujo de trabajo basado en cuadros: precisión a escala

El enfoque basado en fotogramas toma muestras de fotogramas de imágenes a intervalos fijos, elimina fotogramas similares o redundantes y aplica modelos básicos de comprensión de imágenes para extraer información visual a nivel de fotograma. La transcripción de audio se realiza por separado mediante Amazon Transcribe.

Este flujo de trabajo es ideal para:

Seguridad y vigilancia: detectar condiciones o eventos específicos a lo largo del tiempo. Garantía de calidad: monitorear los procesos operativos o de fabricación. Monitoreo del cumplimiento: verificar el cumplimiento de los protocolos de seguridad.

La arquitectura utiliza AWS Step Functions para organizar todo el proceso:

Muestreo inteligente: optimización de costes y calidad

Una característica clave del flujo de trabajo basado en cuadros es la deduplicación inteligente de cuadros, que reduce significativamente los costos de procesamiento al eliminar cuadros redundantes y al mismo tiempo preservar la información visual. La solución proporciona dos métodos distintos de comparación de similitudes.

La comparación de incrustaciones multimodales (MME) de Nova utiliza el modelo de incrustaciones multimodales de Amazon Nova para generar representaciones vectoriales de 256 dimensiones de cada cuadro. Cada cuadro se codifica en una incrustación vectorial utilizando el modelo Nova MME y se calcula la distancia del coseno entre cuadros consecutivos. Los fotogramas con una distancia por debajo del umbral (predeterminado 0,2, donde los valores más bajos indican una mayor similitud) se eliminan. Este enfoque sobresale en la comprensión semántica del contenido de la imagen, siendo resistente a variaciones menores en la iluminación y la perspectiva mientras captura conceptos visuales de alto nivel. Sin embargo, genera costos adicionales de la API de Amazon Bedrock para la generación de integración y agrega una latencia ligeramente mayor por cuadro. Este método se recomienda para contenido donde la similitud semántica importa más que las diferencias a nivel de píxeles, como detectar cambios de escena o identificar momentos únicos.

OpenCV ORB (Oriented FAST and Rotated BRIEF) adopta un enfoque de visión por computadora, utilizando la detección de características para identificar y hacer coincidir puntos clave entre cuadros consecutivos sin requerir llamadas API externas. ORB detecta puntos clave y calcula descriptores binarios para cada cuadro, calculando la puntuación de similitud como la proporción de características coincidentes con el total de puntos clave. Con un umbral predeterminado de 0,325 (donde los valores más altos indican una mayor similitud), este método ofrece un procesamiento rápido con una latencia mínima y sin costos de API adicionales. La coincidencia de características invariantes de rotación lo hace excelente para detectar el movimiento de la cámara y las transiciones de fotogramas. Sin embargo, puede ser sensible a cambios significativos de iluminación y es posible que no capture la similitud semántica con tanta eficacia como los enfoques basados ​​en incrustaciones. Este método se recomienda para escenarios de cámaras estáticas, como imágenes de vigilancia, o aplicaciones sensibles al costo donde la similitud a nivel de píxeles es suficiente.

Flujo de trabajo basado en planos: comprensión del flujo narrativo

En lugar de muestrear fotogramas individuales, el flujo de trabajo basado en tomas segmenta el vídeo en clips cortos (tomas) o segmentos de duración fija y aplica modelos básicos de comprensión del vídeo a cada segmento. Este enfoque captura el contexto temporal dentro de cada toma manteniendo la flexibilidad para procesar videos más largos.

Al generar etiquetas semánticas e incrustaciones para cada toma, este método permite una búsqueda y recuperación de videos eficiente al mismo tiempo que equilibra precisión y flexibilidad. La arquitectura agrupa las tomas en lotes de 10 para el procesamiento paralelo en pasos posteriores, lo que mejora el rendimiento y al mismo tiempo administra los límites de concurrencia de AWS Lambda.

Este flujo de trabajo se destaca en:

Producción de medios: analizar imágenes para marcadores de capítulos y descripciones de escenas. Catalogación de contenido: etiquetar y organizar bibliotecas de videos automáticamente. Generación de momentos destacados: identificar momentos clave en contenido de formato largo.

Segmentación de vídeo: dos enfoques

El flujo de trabajo basado en tomas proporciona opciones de segmentación flexibles para adaptarse a diferentes características de vídeo y casos de uso. El sistema descarga el archivo de video de Amazon Simple Storage Service (Amazon S3) al almacenamiento temporal en AWS Lambda y luego aplica el algoritmo de segmentación seleccionado según los parámetros de configuración.

OpenCV Scene Detección divide automáticamente un vídeo en segmentos según los cambios visuales en el contenido. Este enfoque utiliza la biblioteca PySceneDetect para detectar transiciones como cortes, cambios de cámara o cambios significativos en el contenido visual.

Al identificar los límites de la escena natural, el sistema mantiene agrupados los momentos relacionados. Esto hace que el método sea particularmente efectivo para videos editados o narrativos, como películas, programas de televisión, presentaciones y vlogs, donde las escenas representan unidades de contenido significativas. Debido a que la segmentación sigue la estructura del video en sí, la duración de los segmentos puede variar según el ritmo y el estilo de edición.

La segmentación de duración fija divide un vídeo en intervalos de tiempo de igual duración, independientemente de lo que suceda en el vídeo.

Cada segmento cubre una duración constante (por ejemplo, 10 segundos), lo que crea clips predecibles y uniformes. Este enfoque agiliza el procesamiento y mejora el tiempo de procesamiento y las estimaciones de costos. Aunque puede dividir escenas en mitad de la acción, la segmentación de duración fija funciona bien para grabaciones continuas, como imágenes de vigilancia, eventos deportivos o transmisiones en vivo, donde el muestreo de tiempo regular es más importante que preservar los límites narrativos.

Incrustación multimodal: búsqueda de vídeos semánticos

La incrustación multimodal representa un enfoque emergente para la comprensión de videos, particularmente poderoso para aplicaciones de búsqueda semántica de videos. La solución ofrece flujos de trabajo que utilizan los modelos Amazon Nova Multimodal Embedding y TwelveLabs Marengo disponibles en Amazon Bedrock.

Estos flujos de trabajo permiten:

Búsqueda en lenguaje natural: busque segmentos de vídeo mediante consultas de texto Búsqueda de similitud visual: localice contenido mediante imágenes de referencia Recuperación multimodal: cierre la brecha entre el texto y el contenido visual

La arquitectura admite ambos modelos de integración con una interfaz unificada:

Comprender las compensaciones entre costos y rendimiento

Uno de los desafíos clave en el análisis de video de producción es administrar los costos manteniendo la calidad. La solución proporciona seguimiento integrado del uso de tokens y estimación de costos para ayudarlo a tomar decisiones informadas sobre la selección de modelos y la configuración del flujo de trabajo.

La captura de pantalla anterior muestra una estimación de costos de muestra generada por la solución para ilustrar el formato. No debe usarse como fuente de precios. Para cada video procesado, recibirá un desglose de costos detallado por tipo de modelo, que cubre los modelos básicos de Amazon Bedrock y Amazon Transcribe para la transcripción de audio. Con esta visibilidad, puede mejorar su configuración en función de sus requisitos específicos y restricciones presupuestarias.

Arquitectura del sistema

La solución completa se basa en los servicios sin servidor de AWS, lo que proporciona escalabilidad y rentabilidad:

La arquitectura incluye:

Servicio de extracción: organiza flujos de trabajo basados ​​en cuadros y tomas utilizando Step Functions Servicio Nova: backend para incrustación multimodal Nova con búsqueda de vectores Servicio TwelveLabs: backend para modelos de incrustación de Marengo con búsqueda vectorial Servicio de agente: asistente de inteligencia artificial con tecnología de Amazon Bedrock Agents para recomendaciones de flujo de trabajo Frontend: aplicación React servida usando Amazon CloudFront para la interacción del usuario Servicio de análisis: cuadernos de muestra que demuestran patrones de análisis posteriores

Acceder a los metadatos de tu vídeo

La solución almacena metadatos extraídos en múltiples formatos para un acceso flexible:

Amazon S3: resultados del modelo básico sin procesar, metadatos de tareas completos y activos procesados ​​organizados por ID de tarea y tipo de datos. Amazon DynamoDB: datos estructurados y consultables optimizados para su recuperación por vídeo, marca de tiempo o tipo de análisis en varias tablas para diferentes servicios. API programática: invocación directa para automatización, procesamiento masivo e integración en canalizaciones existentes.

Puede utilizar este modelo de acceso flexible para integrar la herramienta en sus flujos de trabajo, ya sea realizando análisis exploratorios en cuadernos, creando canales automatizados o desarrollando aplicaciones de producción.

Casos de uso del mundo real

La solución incluye cuadernos de muestra que demuestran tres escenarios comunes:

Detección de eventos de cámara IP: supervise automáticamente las imágenes de vigilancia para detectar eventos o condiciones específicas sin supervisión humana constante. Análisis de capítulos de medios: segmente el contenido de vídeo de formato largo en capítulos lógicos con descripciones y metadatos automáticos. Moderación de contenido de redes sociales: revise el contenido de video generado por el usuario a escala para garantizar que se cumplan las pautas de la plataforma.

Estos ejemplos proporcionan puntos de partida que puede ampliar y personalizar para sus casos de uso específicos.

Empezando

Implementar la solución

La solución está disponible como un paquete CDK en GitHub y se puede implementar en su cuenta de AWS con solo unos pocos comandos. La implementación crea todos los recursos necesarios, incluidos:

Step Functions Máquinas de estado para orquestación Funciones Lambda para procesar lógica Tablas de DynamoDB para almacenamiento de metadatos Buckets S3 para almacenamiento de activos Distribución de CloudFront para la interfaz web Grupo de usuarios de Amazon Cognito para autenticación

Después de la implementación, puede comenzar a cargar videos inmediatamente, experimentar con diferentes canales de análisis y modelos básicos, y comparar el rendimiento entre configuraciones.

Conclusión

La comprensión del vídeo ya no se limita a organizaciones con infraestructura y equipos especializados en visión por computadora. Los modelos básicos multimodales de Amazon Bedrock, combinados con los servicios sin servidor de AWS, hacen que el análisis de video sofisticado sea accesible y rentable. Ya sea que esté creando sistemas de monitoreo de seguridad, herramientas de producción de medios o plataformas de moderación de contenido, los tres enfoques arquitectónicos demostrados en esta solución brindan puntos de partida flexibles diseñados para diferentes requisitos. La clave es elegir el enfoque correcto para su caso de uso: basado en cuadros para monitoreo de precisión, basado en planos para contenido narrativo y basado en incrustaciones para búsqueda semántica. A medida que los modelos multimodales continúen evolucionando, veremos surgir capacidades de comprensión de video aún más sofisticadas. El futuro pasa por la IA que no sólo ve fotogramas de vídeo, sino que realmente comprende la historia que cuentan.

¿Listo para empezar?

Más información:

Sobre los autores

Lana Zhang

Lana Zhang es arquitecta senior especializada en soluciones para IA generativa en AWS dentro de la Organización Mundial de Especialistas. Se especializa en IA/ML, con especial atención en casos de uso como asistentes de voz de IA y comprensión multimodal. Trabaja en estrecha colaboración con clientes de diversas industrias, incluidos los medios y el entretenimiento, los juegos, los deportes, la publicidad, los servicios financieros y la atención médica, para ayudarlos a transformar sus soluciones comerciales a través de la IA.

sharon li

Sharon Li es arquitecta de soluciones especializada en IA/ML en Amazon Web Services (AWS) con sede en Boston, Massachusetts. Con una pasión por aprovechar la tecnología de vanguardia, Sharon está a la vanguardia del desarrollo e implementación de soluciones innovadoras de IA generativa en la plataforma en la nube de AWS.