Búsqueda de videos e imágenes en Amazon Bedrock Knowledge Base usando Marengo 3.0

Hoy anunciamos la disponibilidad general de TwelveLabs Marengo Embed 3.0 como modelo de integración en las bases de conocimiento de Amazon Bedrock.

Los activos de vídeo y medios siguen siendo en gran medida inescrutables por su significado. Los equipos de medios, análisis deportivo, educación, seguridad y comercio minorista necesitan encontrar momentos específicos en horas de metraje utilizando lenguaje natural. Una consulta de ejemplo es “muéstrame el tiro penal en la segunda parte”. Hoy en día, construir una búsqueda semántica a través de video requiere unir un complejo proceso de servicios de transcripción, procesos de extracción de fotogramas, modelos de incrustación, bases de datos vectoriales y lógica de sincronización.

Amazon Bedrock Knowledge Bases es un servicio de generación aumentada de recuperación (RAG) totalmente administrado que maneja el almacenamiento, la ingesta, la incorporación, la reclasificación y la recuperación. Admite archivos de vídeo (MP4, MOV), imágenes (JPEG, PNG) y pistas de audio, con conectores nativos para Amazon Simple Storage Service (Amazon S3), SharePoint, Confluence y más.

Marengo Embed 3.0 es un modelo de incrustación multimodal que codifica conjuntamente video, audio, imágenes y texto en un espacio vectorial de 512 dimensiones compacto y eficiente en almacenamiento.

Con Marengo Embed 3.0 ahora disponible como opción de modelo de integración, la búsqueda en lenguaje natural a través de contenido de video, audio e imágenes se convierte en una experiencia totalmente administrada. Las bases de conocimiento administradas (MKB administradas) generan automáticamente incrustaciones multimodales, capturando señales visuales, textuales, de voz y de audio en una representación vectorial unificada.

Tutorial

Este tutorial muestra cómo crear una base de conocimientos (KB) con tecnología de Marengo 3.0 mediante la consola de Amazon Bedrock. El escenario contiene un clip de 10 minutos de la final de la Copa Mundial de la FIFA 2022.

Ingerimos el vídeo y ejecutamos consultas en lenguaje natural.

Requisitos previos

Una cuenta de AWS activa. Si no tiene una, consulte Crear una cuenta de AWS. Acceso a Amazon Bedrock con TwelveLabs Marengo Embed 3.0 habilitado en una región compatible. Para obtener más información, consulte Acceso al modelo en la documentación de Amazon Bedrock. Un depósito de Amazon S3 para almacenar sus archivos de vídeo e imagen. Permisos de AWS Identity and Access Management (IAM) para Amazon Bedrock y Amazon S3.

1. Prepare sus recursos multimedia

Primero, cargue archivos de video en un depósito de Amazon S3. No se requiere preprocesamiento ya que Managed MKB maneja la segmentación, el muestreo de fotogramas y la transcripción internamente.

Figura 1: Bucket de Amazon S3 que contiene el archivo de video de fútbol cargado para la ingesta de la base de conocimientos

2. Cree una base de conocimientos gestionada

En la consola de Amazon Bedrock, navegue hasta Bases de conocimiento y elija Crear KB administrada.

Consola de Amazon Bedrock Knowledge Bases con el botón Crear KB administrada

Figura 2: Consola de Amazon Bedrock Knowledge Bases con el botón Crear base de conocimientos administrada

Expanda el panel Configuración adicional y seleccione el modelo de incrustaciones de Amazon Bedrock para Modelo de incrustaciones. Amazon Titan Text está seleccionado de forma predeterminada. Elija el icono del lápiz para editar la elección del modelo.

Formulario de creación de base de conocimientos con campos de nombre, rol de servicio y modelo de incrustaciones

Figura 3: Formulario de creación de la base de conocimientos que muestra el nombre de la KB, la función del servicio y la configuración del modelo de incorporación

Seleccione TwelveLabs/Marengo Embed 3.0 como se muestra en la siguiente figura.

Diálogo de selección de modelo con TwelveLabs Marengo Embed 3.0 elegido como modelo de incrustación

Figura 4: Cuadro de diálogo de selección de modelo con TwelveLabs Marengo Embed 3.0 seleccionado como modelo de incorporación

A continuación, expanda el panel Fuente de datos, seleccione Amazon S3 como tipo de fuente de datos y configure el URI de S3 del depósito que contiene sus recursos de video.

Panel de origen de datos con Amazon S3 seleccionado y el URI de S3 ingresado

Figura 5: Panel de configuración de origen de datos con Amazon S3 seleccionado y el URI de S3 especificado

En la sección Configuración de segmentación de audio/video en Configuraciones avanzadas, puede configurar las duraciones de la segmentación de audio y video. El valor predeterminado es 4 segundos para ambas modalidades.

Panel de configuración avanzada que muestra la configuración de segmentación de audio y video

Figura 6: Opciones de configuración avanzadas que incluyen configuraciones de segmentación de audio y video

Deje los parámetros avanzados sin cambios y elija Crear base de conocimientos en la parte inferior derecha de la página.

3. Sincroniza e incorpora tus datos

Una vez creada la base de conocimiento, elija Sincronizar para iniciar la ingesta. MKB administrado extrae automáticamente fotogramas, transcribe audio, genera incrustaciones de Marengo Embed 3.0 para cada segmento y escribe vectores en el índice.

Panel de historial de sincronización que muestra un trabajo de ingesta de datos completado

Figura 7: Panel de historial de sincronización que muestra un trabajo de ingesta de datos completado

Puede probar su KB sin salir de la consola usando la función Prueba. Configure cuántos fragmentos de fuente recuperar, aplique filtros de metadatos y ejecute una consulta como “muéstrame los tiros penales de este partido de fútbol”.

La respuesta devuelve resultados clasificados con metadatos que incluyen la hora de inicio y finalización del fragmento, el URI de origen y el tipo de incrustación, para que pueda extraer las secciones relevantes según sea necesario.

En este ejemplo, los mejores resultados identifican los momentos en los que se intentaron tiros penales.

Panel de prueba de la base de conocimientos que muestra resultados de búsqueda semánticos clasificados y reproducción de vídeo

Figura 8: Interfaz de prueba de la base de conocimientos que muestra resultados de búsqueda semántica con reproducción de video y línea de tiempo del fragmento fuente

5. Limpiar

Para limpiar sus recursos, complete los siguientes pasos:

En la consola de Amazon Bedrock, elija Bases de conocimiento. Seleccione su base de conocimientos y anote tanto el nombre del rol de servicio de IAM como el nombre de recurso de Amazon (ARN) del índice de vectores de S3. Elija Eliminar y confirme. En la consola de IAM, busque el rol creado anteriormente durante la creación de la base de conocimientos. Seleccione y elimine el rol. En la consola de Amazon S3, busque su depósito S3. Seleccione y elimine los archivos que cargó para este tutorial.

Integre con su aplicación

Puede utilizar la API de Amazon Bedrock Retrieve para impulsar aplicaciones posteriores. Copie el código de invocación de la página Detalles como punto de partida.

Ejemplo de código Python que utiliza la API de Amazon Bedrock Retrieve para consultar la base de conocimientos

Figura 9: Ejemplo de código Python utilizando la API de Amazon Bedrock Retrieve para consultar la base de conocimientos

La siguiente arquitectura muestra cómo el contenido multimodal fluye desde Amazon S3 a través de bases de conocimiento administradas con Marengo 3.0 para su incrustación e indexación. En sentido descendente, las aplicaciones consultan la base de conocimientos a través de la API de recuperación del SDK de Boto o como un destino de Amazon Bedrock Gateway en Amazon Bedrock AgentCore.

Diagrama de arquitectura del contenido multimodal que fluye desde Amazon S3 a través de bases de conocimiento administradas con Marengo 3.0 hasta aplicaciones posteriores.

Figura 10: Diagrama de arquitectura que muestra el flujo de contenido multimodal desde Amazon S3 a través de bases de conocimiento administradas con Marengo 3.0 hasta aplicaciones posteriores.

Conclusión

Con la disponibilidad general de Marengo 3.0 en Amazon Bedrock Knowledge Bases, ahora puede desbloquear el valor total de sus activos de video, audio e imágenes a través de búsquedas en lenguaje natural, sin crear ni administrar infraestructura compleja. Apunte su fuente de datos, sincronice y busque.

El impacto empresarial abarca industrias:

Análisis deportivo: encuentre jugadas, formaciones o acciones de jugadores específicas en temporadas completas de metraje. Medios y entretenimiento: Gestión de activos multimedia, búsqueda semántica a través de archivos multimedia o contenidos de servicios de streaming. Seguridad y protección: busque imágenes de cámaras de seguridad para incidentes o actividades específicas. Educación y capacitación: ubique segmentos de conferencias por concepto, no solo por palabras clave. Comercio minorista: busque vídeos de demostración de productos para ver demostraciones de funciones.

Disponibilidad y precios

Las bases de conocimiento administradas para Amazon Bedrock con Marengo Embed 3.0 están disponibles en la región de AWS Este de EE. UU. (Norte de Virginia) (us-east-1) y en la Región de EE. UU. Oeste (Norte de California) (us-west-1). Para obtener una lista completa de los modelos y regiones admitidos, consulte Modelos admitidos por región de AWS en Amazon Bedrock.

Con Managed Knowledge Bases para Amazon Bedrock, usted paga solo por lo que almacena y recupera. La generación de incrustaciones con Marengo Embed 3.0 se cobra según la tarifa de invocación del modelo estándar de Amazon Bedrock.

Para obtener más información, consulte la página de documentación de precios.

Próximos pasos

Comience con la recuperación multimodal totalmente administrada:

Explore la documentación: revise la documentación de las bases de conocimientos de Amazon Bedrock y cree una base de conocimientos administrada para obtener detalles técnicos adicionales. Experimente con ejemplos de código: consulte el repositorio de muestras de Amazon Bedrock para obtener cuadernos prácticos que demuestran la recuperación multimodal. Obtenga más información sobre Marengo Embed 3.0: consulte la documentación de Marengo 3.0 para obtener información técnica más profunda.

Sobre los autores

Eric Kim

Eric Kim

Eric es gerente de productos de personal y dirige Marengo y Search en TwelveLabs, donde da forma a la investigación de modelos de vanguardia y crea soluciones para la búsqueda multimodal y la comprensión de videos. Trabaja con investigadores, ingenieros y clientes para convertir los avances en inteligencia artificial en productos que ayuden a los humanos a dar sentido a las colecciones de videos a escala.

Narcisse Zekpa

Narcisse Zekpa

Narcisse es un arquitecto de soluciones sénior con sede en Boston. Ayuda a los clientes del noreste de EE. UU. a acelerar la transformación de sus negocios a través de soluciones innovadoras y escalables en la nube de AWS. Le apasiona permitir que las organizaciones transformen sus negocios mediante análisis avanzados e inteligencia artificial. Cuando Narcisse no está construyendo, le gusta pasar tiempo con su familia, viajar y correr.

Amit Choudhary

Amit Choudhary

Amit es director principal de productos en AWS, donde dirige la estrategia de productos para las bases de conocimiento de Amazon Bedrock y Amazon Quick. Le apasiona hacer que la generación de recuperación aumentada (RAG) multimodal sea accesible, segura y lista para producción para clientes empresariales.

Adam Stanley

Adam Stanley

Adam es un arquitecto de soluciones de AWS con sede en Seattle. Con experiencia en estadística y aprendizaje automático, cubre la mayoría de las áreas del aprendizaje automático en su trabajo con clientes, con un enfoque reciente específicamente en el hardware AI Accelerator, como GPU o AWS Trainium.