Nos complace anunciar la disponibilidad general de la recuperación multimodal para las bases de conocimiento de Amazon Bedrock. Esta nueva capacidad agrega soporte nativo para contenido de video y audio, además de texto e imágenes. Con él, puede crear aplicaciones de recuperación de generación aumentada (RAG) que pueden buscar y recuperar información en texto, imágenes, audio y video, todo dentro de un servicio totalmente administrado.
Las empresas modernas almacenan información valiosa en múltiples formatos. La documentación del producto incluye diagramas y capturas de pantalla, los materiales de capacitación contienen videos instructivos y las opiniones de los clientes se capturan en reuniones grabadas. Hasta ahora, crear aplicaciones de inteligencia artificial (IA) que pudieran realizar búsquedas efectivas en estos tipos de contenido requería una infraestructura personalizada compleja y un importante esfuerzo de ingeniería.
Anteriormente, Bedrock Knowledge Bases utilizaba modelos de incrustación basados en texto para la recuperación. Si bien admitía documentos de texto e imágenes, las imágenes debían procesarse utilizando modelos básicos (FM) o Bedrock Data Automation para generar descripciones de texto, un enfoque basado en el texto que perdía el contexto visual e impedía las capacidades de búsqueda visual. El vídeo y el audio requerían canalizaciones externas de preprocesamiento personalizado. Ahora, con incrustaciones multimodales, el recuperador admite de forma nativa texto, imágenes, audio y video dentro de un único modelo de incrustación.
Con la recuperación multimodal en Bedrock Knowledge Bases, ahora puede ingerir, indexar y recuperar información de texto, imágenes, video y audio mediante un flujo de trabajo único y unificado. El contenido se codifica mediante incrustaciones multimodales que preservan el contexto visual y de audio, lo que permite que sus aplicaciones encuentren información relevante en todos los tipos de medios. Incluso puedes buscar usando una imagen para encontrar contenido visualmente similar o localizar escenas específicas en videos.
En esta publicación, lo guiaremos en la creación de aplicaciones RAG multimodales. Aprenderá cómo funcionan las bases de conocimiento multimodal, cómo elegir la estrategia de procesamiento adecuada según su tipo de contenido y cómo configurar e implementar la recuperación multimodal utilizando la consola y los ejemplos de código.
Comprender las bases de conocimiento multimodales
Amazon Bedrock Knowledge Bases automatiza todo el flujo de trabajo de RAG: ingesta de contenido de sus fuentes de datos, análisis y fragmentación en segmentos con capacidad de búsqueda, conversión de fragmentos en incrustaciones de vectores y almacenamiento en una base de datos de vectores. Durante la recuperación, las consultas de los usuarios se incrustan y comparan con los vectores almacenados para encontrar contenido semánticamente similar, lo que aumenta el mensaje enviado a su modelo básico.
Con la recuperación multimodal, este flujo de trabajo ahora maneja imágenes, videos y audio junto con texto a través de dos enfoques de procesamiento. Amazon Nova Multimodal Embeddings codifica contenido de forma nativa en un espacio vectorial unificado, para la recuperación multimodal donde puede realizar consultas con texto y recuperar videos, o buscar usando imágenes para encontrar contenido visual.
Alternativamente, Bedrock Data Automation convierte multimedia en descripciones y transcripciones de texto enriquecido antes de incrustarlos, proporcionando una recuperación de alta precisión sobre el contenido hablado. Su elección depende de si el contexto visual o la precisión del habla son más importantes para su caso de uso.
Exploramos cada uno de estos enfoques en esta publicación.
Incorporaciones multimodales de Amazon Nova
Amazon Nova Multimodal Embeddings es el primer modelo de incrustación unificado que codifica texto, documentos, imágenes, videos y audio en un único espacio vectorial compartido. El contenido se procesa de forma nativa sin conversión de texto. El modelo admite hasta 8172 tokens para texto y 30 segundos para segmentos de video/audio, maneja más de 200 idiomas y ofrece cuatro dimensiones de incrustación (con 3072 dimensiones por defecto, 1024, 384, 256) para equilibrar precisión y eficiencia. Bedrock Knowledge Bases segmenta el vídeo y el audio automáticamente en fragmentos configurables (de 5 a 30 segundos), y cada segmento se integra de forma independiente.
Para el contenido de video, las incrustaciones de Nova capturan elementos visuales (escenas, objetos, movimiento y acciones), así como características de audio como música, sonidos y ruido ambiental. Para videos donde el diálogo hablado es importante para su caso de uso, puede usar Bedrock Data Automation para extraer transcripciones junto con descripciones visuales. Para archivos de audio independientes, Nova procesa características acústicas como música, sonidos ambientales y patrones de audio. La capacidad multimodal permite casos de uso como describir una escena visual en texto para recuperar videos coincidentes, cargar una imagen de referencia para encontrar productos similares o localizar acciones específicas en imágenes, todo sin descripciones de texto preexistentes.
Ideal para: catálogos de productos, búsqueda visual, videos de fabricación, secuencias deportivas, cámaras de seguridad y escenarios donde el contenido visual impulsa el caso de uso.
Automatización de datos de Amazon Bedrock
Bedrock Data Automation adopta un enfoque diferente al convertir contenido multimedia en representaciones textuales enriquecidas antes de incrustarlo. Para imágenes, genera descripciones detalladas que incluyen objetos, escenas, texto dentro de imágenes y relaciones espaciales. Para vídeo, produce resúmenes escena por escena, identifica elementos visuales clave y extrae el texto en pantalla. Para audio y video con voz, Bedrock Data Automation proporciona transcripciones precisas con marcas de tiempo e identificación del hablante, junto con resúmenes de segmentos que capturan los puntos clave discutidos.
Una vez convertido a texto, este contenido se fragmenta e incrusta utilizando modelos de incrustación de texto como Amazon Titan Text Embeddings o Amazon Nova Multimodal Embeddings. Este enfoque basado en el texto permite responder preguntas con gran precisión sobre el contenido hablado: cuando los usuarios preguntan sobre declaraciones específicas hechas en una reunión o temas discutidos en un podcast, el sistema busca en transcripciones precisas en lugar de incrustaciones de audio. Esto lo hace particularmente valioso para escenarios de cumplimiento en los que necesita citas exactas y registros textuales para pistas de auditoría, análisis de reuniones, extracción de llamadas de atención al cliente y casos de uso en los que necesita recuperar y verificar información hablada específica.
Ideal para: reuniones, seminarios web, entrevistas, podcasts, vídeos de formación, llamadas de soporte y escenarios que requieren una recuperación precisa de declaraciones o debates específicos.
Escenario de caso de uso: búsqueda visual de productos para comercio electrónico
Las bases de conocimientos multimodales se pueden utilizar para aplicaciones que van desde experiencias mejoradas de los clientes y capacitación de empleados hasta operaciones de mantenimiento y análisis legales. La búsqueda tradicional del comercio electrónico se basa en consultas de texto, lo que requiere que los clientes articulen lo que buscan con las palabras clave adecuadas. Esto se rompe cuando han visto un producto en otro lugar, tienen una foto de algo que les gusta o quieren encontrar artículos similares a los que aparecen en un video. Ahora, los clientes pueden buscar en su catálogo de productos usando descripciones de texto, cargar una imagen de un artículo que hayan fotografiado o hacer referencia a una escena de un video para encontrar productos coincidentes. El sistema recupera elementos visualmente similares comparando la representación incrustada de su consulta (ya sea texto, imagen o video) con las incrustaciones multimodales de su inventario de productos. Para este escenario, Amazon Nova Multimodal Embeddings es la opción ideal. El descubrimiento de productos es fundamentalmente visual: los clientes se preocupan por los colores, estilos, formas y detalles visuales. Al codificar las imágenes y los vídeos de sus productos en el espacio vectorial unificado de Nova, el sistema realiza coincidencias en función de la similitud visual sin depender de descripciones de texto que podrían pasar por alto características visuales sutiles. Si bien un sistema de recomendación completo incorporaría las preferencias del cliente, el historial de compras y la disponibilidad del inventario, la recuperación de una base de conocimiento multimodal proporciona la capacidad fundamental: encontrar productos visualmente relevantes independientemente de cómo los clientes elijan buscar.
Tutorial de la consola
En la siguiente sección, repasamos los pasos de alto nivel para configurar y probar una base de conocimientos multimodal para nuestro ejemplo de búsqueda de productos de comercio electrónico. Creamos una base de conocimientos que contiene imágenes y vídeos de productos de teléfonos inteligentes y luego demostramos cómo los clientes pueden buscar mediante descripciones de texto, imágenes cargadas o referencias de vídeos. El repositorio de GitHub proporciona un cuaderno guiado que puede seguir para implementar este ejemplo en su cuenta.
Requisitos previos
Antes de comenzar, asegúrese de tener los siguientes requisitos previos:
Proporcionar los detalles de la base de conocimientos y el tipo de fuente de datos.
Comience abriendo la consola de Amazon Bedrock y creando una nueva base de conocimientos. Proporcione un nombre descriptivo para su base de conocimientos y seleccione su tipo de fuente de datos; en este caso, Amazon S3, donde se almacenan las imágenes y videos de sus productos.
Configurar fuente de datos
Conecte su depósito S3 que contiene imágenes y videos de productos. Para la estrategia de análisis, seleccione el analizador predeterminado de Amazon Bedrock. Dado que utilizamos Nova Multimodal Embeddings, las imágenes y los videos se procesan de forma nativa y se incrustan directamente en el espacio vectorial unificado, preservando sus características visuales sin conversión a texto.
Configurar el almacenamiento y procesamiento de datos
Seleccione Amazon Nova Multimodal Embeddings como modelo de inserción. Este modelo de incrustación unificado codifica tanto las imágenes de sus productos como las consultas de los clientes en el mismo espacio vectorial, lo que permite la recuperación multimodal donde las consultas de texto pueden recuperar imágenes y las consultas de imágenes pueden encontrar productos visualmente similares. Para este ejemplo, utilizamos Amazon S3 Vectors como almacén de vectores (opcionalmente, puede usar otros almacenes de vectores disponibles), que proporciona un almacenamiento rentable y duradero optimizado para conjuntos de datos vectoriales a gran escala, manteniendo al mismo tiempo el rendimiento de las consultas en menos de un segundo. También debe configurar el destino de almacenamiento multimodal especificando una ubicación de S3. Knowledge Bases utiliza esta ubicación para almacenar imágenes extraídas y otros medios de su fuente de datos. Cuando los usuarios consultan la base de conocimientos, los medios relevantes se recuperan de este almacenamiento.
Revisar y crear
Revise sus ajustes de configuración, incluidos los detalles de la base de conocimientos, la configuración del origen de datos, la selección del modelo de incorporación (estamos usando Amazon Nova Multimodal Embeddings v1 con 3072 dimensiones vectoriales (las dimensiones más altas proporcionan representaciones más ricas; puede usar dimensiones más bajas como 1024, 384 o 256 para optimizar el almacenamiento y el costo)) y la configuración del almacén de vectores (Amazon S3 Vectors). Una vez que todo parezca correcto, cree su base de conocimientos.
Crear un trabajo de ingesta
Una vez creado, inicie el proceso de sincronización para incorporar su catálogo de productos. La base de conocimiento procesa cada imagen y video, genera incrustaciones y los almacena en la base de datos vectorial administrada. Supervise el estado de sincronización para confirmar que los documentos se indexen correctamente.
Pruebe la base de conocimientos utilizando texto como entrada en su mensaje
Con su base de conocimientos lista, pruébela mediante una consulta de texto en la consola. Busque descripciones de productos como "Una funda metálica para teléfono" (o cualquier equivalente que pueda ser relevante para los medios de sus productos) para verificar que la recuperación basada en texto funcione correctamente en todo su catálogo.
Pruebe la base de conocimientos utilizando una imagen de referencia y recupere diferentes modalidades.
Ahora viene la parte poderosa: la búsqueda visual. Sube una imagen de referencia de un producto que desees encontrar. Por ejemplo, imagina que viste una funda para celular en otro sitio web y quieres encontrar artículos similares en tu catálogo. Simplemente cargue la imagen sin mensaje de texto adicional.
La base de conocimientos multimodal extrae características visuales de la imagen cargada y recupera productos visualmente similares de su catálogo. Como puede ver en los resultados, el sistema devuelve fundas para teléfonos con patrones de diseño, colores o características visuales similares. Observe los metadatos asociados con cada fragmento en el panel de detalles de la fuente. Los campos x-amz-bedrock-kb-chunk-start-time-in-millis y x-amz-bedrock-kb-chunk-end-time-in-millis indican la ubicación temporal exacta de este segmento dentro del vídeo de origen. Al crear aplicaciones mediante programación, puede usar estas marcas de tiempo para extraer y mostrar el segmento de video específico que coincidió con la consulta, habilitando funciones como "saltar al momento relevante" o generación de clips directamente desde sus videos de origen. Esta capacidad intermodal transforma la experiencia de compra: los clientes ya no necesitan describir con palabras lo que buscan; te lo pueden mostrar.
Pruebe la base de conocimientos utilizando una imagen de referencia y recupere diferentes modalidades utilizando Bedrock Data Automation
Ahora veremos cómo se verían los resultados si configurara el análisis de Bedrock Data Automation durante la configuración de la fuente de datos. En la siguiente captura de pantalla, observe la sección de transcripción en el panel de detalles de la fuente.
Para cada fragmento de video recuperado, Bedrock Data Automation genera automáticamente una descripción de texto detallada; en este ejemplo, describe el acabado metálico en oro rosa del teléfono inteligente, la iluminación del estudio y las características visuales. Esta transcripción aparece directamente en la ventana de prueba junto al video, lo que proporciona un contexto textual enriquecido. Obtiene similitudes visuales de las incrustaciones multimodales y descripciones detalladas de productos que pueden responder preguntas específicas sobre características, colores, materiales y otros atributos visibles en el video.
Limpieza
Para limpiar sus recursos, complete los siguientes pasos, comenzando por eliminar la base de conocimientos:
En la consola de Amazon Bedrock, elija Bases de conocimientos. Seleccione su base de conocimientos y anote tanto el nombre del rol de servicio de IAM como el ARN del índice vectorial de S3. Elija Eliminar y confirme.
Para eliminar S3 Vector como almacén de vectores, utilice los siguientes comandos de AWS Command Line Interface (AWS CLI):
En la consola de IAM, busque la función indicada anteriormente. Seleccione y elimine la función.
Para eliminar el conjunto de datos de muestra:
En la consola de Amazon S3, busque su depósito S3. Seleccione y elimine los archivos que cargó para este tutorial.
Conclusión
La recuperación multimodal para Amazon Bedrock Knowledge Bases elimina la complejidad de crear aplicaciones RAG que abarquen texto, imágenes, video y audio. Con soporte nativo para contenido de video y audio, ahora puede crear bases de conocimiento integrales que desbloquean conocimientos de los datos de su empresa, no solo de documentos de texto.
La elección entre Amazon Nova Multimodal Embeddings y Bedrock Data Automation le brinda flexibilidad para optimizar su contenido específico. El espacio vectorial unificado de Nova permite la recuperación intermodal para casos de uso visuales, mientras que el enfoque de texto primero de Bedrock Data Automation ofrece una recuperación precisa basada en transcripción para contenido con mucho habla. Ambos enfoques se integran perfectamente en el mismo flujo de trabajo totalmente administrado, aliviando la necesidad de canales de preprocesamiento personalizados.
Disponibilidad
La disponibilidad regional depende de las funciones seleccionadas para el soporte multimodal; consulte la documentación para obtener más detalles.
Próximos pasos
Comience hoy con la recuperación multimodal:
Explore la documentación: revise la documentación de las bases de conocimientos de Amazon Bedrock y la guía del usuario de Amazon Nova para obtener detalles técnicos adicionales. Experimente con ejemplos de código: consulte el repositorio de muestras de Amazon Bedrock para obtener cuadernos prácticos que demuestran la recuperación multimodal. Obtenga más información sobre Nova: lea el anuncio de Amazon Nova Multimodal Embeddings para obtener información técnica más profunda.
Sobre los autores
Dani Mitchell es arquitecto de soluciones especialista en IA generativa en Amazon Web Services (AWS). Su objetivo es ayudar a acelerar empresas de todo el mundo en sus viajes de IA generativa con Amazon Bedrock y Bedrock AgentCore.
Pallavi Nargund es arquitecto principal de soluciones en AWS. Es líder de IA generativa para US Greenfield y dirige el equipo de AWS para tecnología legal. Le apasionan las mujeres en la tecnología y es miembro principal de Women in AI/ML en Amazon. Habla en conferencias internas y externas como AWS re:Invent, AWS Summits y seminarios web. Pallavi tiene una Licenciatura en Ingeniería de la Universidad de Pune, India. Vive en Edison, Nueva Jersey, con su marido, sus dos hijas y sus dos cachorros.
Jean-Pierre Dodel es director principal de productos de Amazon Bedrock, Amazon Kendra y Amazon Quick Index. Aporta al equipo 15 años de experiencia en búsqueda empresarial e IA/ML, con trabajo previo en Autonomy, HP y nuevas empresas de búsqueda antes de unirse a Amazon hace 8 años. Actualmente, JP se centra en innovaciones para RAG multimodal, recuperación de agentes y RAG estructurado.