Si está buscando mejorar la comprensión de su contenido y sus capacidades de búsqueda, las incrustaciones de audio ofrecen una solución poderosa. En esta publicación, aprenderá a utilizar Amazon Nova Multimodal Embeddings para transformar su contenido de audio en datos inteligentes con capacidad de búsqueda que capturen características acústicas como tono, emoción, características musicales y sonidos ambientales.
Encontrar contenido específico en estas bibliotecas presenta desafíos técnicos reales. Los métodos de búsqueda tradicionales, como la transcripción manual, el etiquetado de metadatos y la conversión de voz a texto, funcionan bien para capturar y buscar palabras habladas. Sin embargo, estos enfoques basados en texto se centran en el contenido lingüístico más que en propiedades acústicas como el tono, las emociones, las características musicales y los sonidos ambientales. Las incorporaciones de audio abordan esta brecha. Representan su audio como vectores numéricos densos en un espacio de alta dimensión que codifican propiedades tanto semánticas como acústicas. Estas representaciones le permiten realizar búsquedas semánticas utilizando consultas en lenguaje natural, hacer coincidir audios con sonidos similares y categorizar automáticamente el contenido en función de cómo suena en lugar de solo etiquetas de metadatos. Amazon Nova Multimodal Embeddings, anunciado el 28 de octubre de 2025, es un modelo de integración multimodal disponible en Amazon Bedrock[1]. Es el modelo de incrustación unificado que admite texto, documentos, imágenes, video y audio a través de un único modelo para la recuperación multimodal con precisión.
Esta publicación lo guiará para comprender las incrustaciones de audio, implementar las incrustaciones multimodales de Amazon Nova y crear un sistema de búsqueda práctico para su contenido de audio. Aprenderá cómo las incrustaciones representan audio como vectores, explorará las capacidades técnicas de Amazon Nova y verá ejemplos de código prácticos para indexar y consultar sus bibliotecas de audio. Al final, tendrá el conocimiento para implementar capacidades de búsqueda de audio listas para producción.
Comprensión de las incrustaciones de audio: conceptos básicos
Representaciones vectoriales para contenido de audio
Piense en las incrustaciones de audio como un sistema de coordenadas para el sonido. Así como el GPS coordina ubicaciones precisas en la Tierra, las incrustaciones asignan su contenido de audio a puntos específicos en el espacio de alta dimensión. Amazon Nova Multimodal Embeddings le ofrece opciones de cuatro dimensiones: 3072 (predeterminado), 1024, 384 o 256[1]. Cada incrustación es una matriz float32. Las dimensiones individuales codifican características acústicas y semánticas (ritmo, tono, timbre, tono emocional y significado semántico), todas aprendidas a través de la arquitectura de red neuronal del modelo durante el entrenamiento. Amazon Nova utiliza Matryoshka Representation Learning (MRL), una técnica que estructura las incorporaciones jerárquicamente[1]. Piense en MRL como si fueran muñecos rusos que anidan. Una incrustación de 3072 dimensiones contiene toda la información, pero puede extraer solo las primeras 256 dimensiones y aún así obtener resultados precisos. Genere incrustaciones una vez y luego elija el tamaño que equilibre la precisión con los costos de almacenamiento. No es necesario reprocesar el audio al probar diferentes dimensiones: la estructura jerárquica le permite truncarlo al tamaño que prefiera.
Cómo se mide la similitud: cuando desea encontrar audio similar, calcula la similitud del coseno entre dos incrustaciones v₁ y v₂[1]:
similitud = (v₁ · v₂) / (||v₁|| × ||v₂||)
La similitud del coseno mide el ángulo entre vectores, dándole valores de -1 a 1. Los valores más cercanos a 1 indican una mayor similitud semántica. Cuando almacena incrustaciones en una base de datos vectorial, utiliza métricas de distancia (distancia = 1 – similitud) para realizar búsquedas de k vecinos más cercanos (k-NN), recuperando las k incrustaciones más similares para su consulta.
Ejemplo del mundo real: supongamos que tiene dos clips de audio (“un violín tocando una melodía” y “un violonchelo tocando una melodía similar”) que generan incrustaciones v₁ y v₂. Si su similitud de cosenos es 0,87, se agrupan uno cerca del otro en el espacio vectorial, lo que indica una fuerte relación acústica y semántica. Un clip de audio diferente, como “música rock con batería”, genera v₃ con una similitud de coseno de 0,23 a v₁, colocándolo muy lejos en el espacio de incrustación.
Arquitectura y modalidades de procesamiento de audio.
Comprender el flujo de trabajo de un extremo a otro: antes de profundizar en los detalles técnicos, veamos cómo funcionan las incrustaciones de audio en la práctica. Hay dos flujos de trabajo principales:
Figura 1: flujo de trabajo de incorporación de audio de un extremo a otro
Ingestión de datos y flujo de indexación: durante la fase de ingesta, procesa su biblioteca de audio de forma masiva. Usted carga archivos de audio en Amazon S3 y luego utiliza la API asincrónica para generar incrustaciones. Para archivos de audio largos (más de 30 segundos), el modelo los segmenta automáticamente en fragmentos más pequeños con metadatos temporales. Estas incrustaciones se almacenan en una base de datos vectorial junto con metadatos como el nombre del archivo, la duración y el género. Esto sucede una vez para toda su biblioteca de audio.
Flujo de búsqueda en tiempo de ejecución: cuando un usuario busca, utiliza la API sincrónica para generar una incrustación para su consulta, ya sea un texto como "piano de jazz optimista" u otro clip de audio. Debido a que las consultas son breves y los usuarios esperan resultados rápidos, la API síncrona proporciona respuestas de baja latencia. La base de datos vectorial realiza una búsqueda k-NN para encontrar las incrustaciones de audio más similares y arroja resultados con sus metadatos asociados. Toda esta búsqueda ocurre en milisegundos.
Cuando envía entradas de solo audio, las redes convolucionales temporales o las arquitecturas basadas en transformadores analizan sus señales acústicas en busca de patrones espectrotemporales. En lugar de trabajar con formas de onda sin procesar, Amazon Nova opera en representaciones de audio como espectrogramas de fusión o funciones de audio aprendidas, lo que permite un procesamiento eficiente de audio de alta frecuencia de muestreo.[1]El audio son datos secuenciales que requieren un contexto temporal. Sus segmentos de audio (hasta 30 segundos) pasan a través de arquitecturas con campos receptivos temporales que capturan patrones acústicos a través del tiempo.[1]. Este enfoque captura el ritmo, la cadencia, la prosodia y las dependencias acústicas de largo alcance que abarcan varios segundos, preservando toda la riqueza de su contenido de audio.
Operaciones API y estructuras de solicitudes
Cuándo utilizar la generación de incrustaciones sincrónicas: use la API invoke_model para la búsqueda en tiempo de ejecución cuando necesite incrustaciones para aplicaciones en tiempo real donde la latencia importa[1]. Por ejemplo, cuando un usuario envía una consulta de búsqueda, el texto de la consulta es corto y desea brindar una experiencia de usuario rápida; la API sincrónica es ideal para esto:
import boto3 import json # Crea el cliente Bedrock Runtime. bedrock_runtime = boto3.client("bedrock-runtime", region_name="us-east-1") # Definir el cuerpo de la solicitud para una consulta de búsqueda. request_body = { "taskType": "SINGLE_EMBEDDING", # Usar para elementos individuales "singleEmbeddingParams": { "embeddingPurpose": "GENERIC_RETRIEVAL", # Usar GENERIC_RETRIEVAL para consultas "embeddingDimension": 1024, # Elegir tamaño de dimensión "text": { "truncationMode": "END", # Cómo manejar entradas largas "value": "jazz piano music" # Tu consulta de búsqueda } } } # Invocar el modelo Nova Embeddings. respuesta = bedrock_runtime.invoke_model( body=json.dumps(request_body), modelId="amazon.nova-2-multimodal-embeddings-v1:0", contentType="application/json" ) # Extrae la incrustación de la respuesta. cuerpo_respuesta = json.loads(respuesta["cuerpo"].read()) incrustación = cuerpo_respuesta["incrustaciones"][0]["incrustación"] # matriz float32
Comprensión de los parámetros de solicitud:
taskType: elija SINGLE_EMBEDDING para elementos individuales o SEGMENTED_EMBEDDING para procesamiento fragmentado [1, 2] incrustaciónPropósito: optimiza las incrustaciones para su caso de uso: GENERIC_INDEX para indexar su contenido, GENERIC_RETRIEVAL para consultas, DOCUMENT_RETRIEVAL para búsqueda de documentos[1]embeddingDimension: su elección de dimensión de salida (3072, 1024, 384, 256)[1]truncationMode: cómo manejar entradas que exceden la longitud del contexto: END se trunca al final, START al principio[1]
Lo que obtienes a cambio: la API devuelve un objeto JSON que contiene tu incrustación:
{ "incrustaciones": [ { "incrustación": [0.123, -0.456, 0.789, …], // matriz float32 "incrustaciónLongitud": 1024 } ] }
Cuándo utilizar el procesamiento asincrónico: Amazon Nova Multimodal Embeddings admite dos enfoques para procesar grandes volúmenes de contenido: la API asincrónica y la API por lotes. Comprender cuándo utilizar cada uno le ayudará a optimizar su flujo de trabajo.
API asincrónica: utilice la API start_async_invoke cuando necesite procesar archivos de audio o vídeo individuales de gran tamaño que excedan los límites de la API sincrónica.[1]. Esto es ideal para:
Procesamiento de archivos únicos de gran tamaño (grabaciones de varias horas, videos completos) Archivos que requieren segmentación (más de 30 segundos) Cuando necesita resultados en cuestión de horas pero no inmediatamente respuesta = bedrock_runtime.start_async_invoke( modelId="amazon.nova-2-multimodal-embeddings-v1:0", modelInput=model_input, outputDataConfig={ "s3OutputDataConfig": {"s3Uri": "s3://amzn-s3-demo-bucket/output/"} } ) invocation_arn = respuesta["invocationArn"] # Encuesta del estado del trabajo trabajo = bedrock_runtime.get_async_invoke(invocationArn=invocation_arn) status = trabajo["status"] # "En progreso" | "Completado" | "Fallido"
Cuando se completa su trabajo, escribe la salida en Amazon S3 en formato JSONL (un objeto JSON por línea). Para el modo AUDIO_VIDEO_COMBINED, encontrará la salida en embedding-audio-video.jsonl[1].
API por lotes: utilice la API de inferencia por lotes cuando necesite procesar miles de archivos de audio en un solo trabajo.[3].
Esto es ideal para:
Procesamiento masivo de toda su biblioteca de audio (de miles a millones de archivos) Optimización de costos a través de precios por lotes Operaciones de indexación no urgentes donde puede esperar entre 24 y 48 horas Procesamiento eficiente de muchos archivos de tamaño pequeño a mediano
La API por lotes ofrece una mejor rentabilidad para operaciones a gran escala y gestiona la gestión de trabajos automáticamente. Usted envía un archivo de manifiesto con todos sus archivos de entrada y el servicio los procesa en paralelo y escribe los resultados en S3.
Elegir entre asíncrono y por lotes:
¿Necesita un único archivo grande o segmentación en tiempo real? → Utilice API asíncrona ¿Miles de archivos para procesar de forma masiva? → Utilice API por lotes ¿Necesita resultados en cuestión de horas? → Utilice API asíncrona. ¿Puede esperar entre 24 y 48 horas para ahorrar costos? → Usar API por lotes
Obtenga más información sobre la inferencia por lotes en la documentación de inferencia por lotes de Amazon Bedrock.[3]
Segmentación y metadatos temporales
Por qué necesitas segmentación: si tus archivos de audio superan los 30 segundos, debes segmentarlos[1]. Imagine que tiene un podcast de 2 horas y desea encontrar el segmento específico de 30 segundos donde el presentador habla sobre la IA; la segmentación lo hace posible.
Controlas la fragmentación con el parámetro segmentationConfig:
"segmentationConfig": { "durationSeconds": 15 # Genera una incrustación cada 15 segundos } Esta configuración procesa un archivo de audio de 5 minutos (300 segundos) en 20 segmentos (300 ÷ 15 = 20), generando 20 incrustaciones[1]. Cada segmento recibe metadatos temporales que marcan su posición en su archivo original.
Comprensión de la salida segmentada: la API asincrónica escribe sus incrustaciones segmentadas en JSONL con metadatos temporales[1]:
{"startTime": 0.0, "endTime": 15.0, "incrustación": […]} {"startTime": 15.0, "endTime": 30.0, "incrustación": […]} {"startTime": 30.0, "endTime": 45.0, "incrustación": […]}
Cómo analizar la salida segmentada:
importar json desde boto3 importar cliente s3 = client("s3", region_name="us-east-1") # Leer el archivo JSONL de S3 respuesta = s3.get_object(Bucket="bucket", Key="output/embedding-audio-video.jsonl") contenido = respuesta['Body'].read().decode('utf-8') segmentos =[]para línea en content.strip().split('n'): if line: segment = json.loads(line) segments.append({ 'start': segment['startTime'], 'end': segment['endTime'], 'embedding': segment['embedding'], 'duration': segment['endTime'] – segment['startTime'] }) print(f"Procesado {len(segmentos)} segmentos") print(f"Primer segmento: {segmentos[0]['inicio']:.1f}s – {segmentos[0]['end']:.1f}s") print(f"Dimensión de incrustación: {len(segmentos)[0]['incrustación'])}")
Caso de uso del mundo real: búsqueda temporal: puede almacenar incrustaciones segmentadas con sus metadatos temporales en una base de datos vectorial. Cuando alguien busca "queja de un cliente sobre facturación", usted recupera los segmentos específicos de 15 segundos con marcas de tiempo, lo que le brinda una navegación precisa a momentos relevantes dentro de grabaciones de llamadas de varias horas. No es necesario escuchar la grabación completa.
Estrategias de indexación y almacenamiento de vectores
En referencia a la arquitectura: en la Sección 2.2, le mostramos el diagrama de flujo de trabajo de un extremo a otro. Ahora profundizaremos en el componente Vector Database: la capa de almacenamiento donde residen sus incorporaciones durante la fase de ingesta y la fase de búsqueda en tiempo de ejecución. Este es el componente crítico que conecta sus incrustaciones de audio indexadas con consultas de búsqueda rápidas.
Comprender sus requisitos de almacenamiento: las incrustaciones son matrices float32 que requieren 4 bytes por dimensión. Esto es lo que necesitarás:
3072 dimensiones: 12 288 bytes (12 KB) por incrustación 1024 dimensiones: 4096 bytes (4 KB) por incrustación 384 dimensiones: 1536 bytes (1,5 KB) por incrustación 256 dimensiones: 1024 bytes (1 KB) por incrustación
Cálculo de ejemplo: para 1 millón de clips de audio con incrustaciones de 1024 dimensiones, necesita 4 GB de almacenamiento vectorial (sin incluir metadatos ni estructuras de índice).
Elegir el tamaño de su dimensión: las dimensiones más grandes le brindan representaciones más detalladas, pero requieren más almacenamiento y cálculo. Las dimensiones más pequeñas ofrecen un equilibrio práctico entre el rendimiento de recuperación y la eficiencia de los recursos. Comience con 1024 dimensiones: proporciona una precisión excelente para la mayoría de las aplicaciones y, al mismo tiempo, mantiene los costos manejables.
Uso de Amazon S3 Vectors: puede almacenar y consultar sus incrustaciones utilizando Amazon S3 Vectors[2]:
s3vectors = boto3.client("s3vectors", region_name="us-east-1") # Crear índice vectorial s3vectors.create_index( vectorBucketName="audio-vectors", indexName="audio-embeddings", dimension=1024, dataType="float32", DistanceMetric="cosine" ) # Almacenar incrustaciones con metadatos s3vectors.put_vectors( vectorBucketName="audio-vectors", indexName="audio-embeddings", vectores=[{ "key": "audio:track_12345", "data": {"float32": embedding}, "metadata": { "filename": "track_12345.mp3", "duration": 180.5, "genre": "jazz", "upload_date": "2025-10-28" } }] )
Cómo los metadatos mejoran su búsqueda: los atributos de metadatos funcionan junto con las incrustaciones para proporcionar resultados de búsqueda más completos. Cuando recupera resultados de la base de datos vectorial, los metadatos lo ayudan a filtrar, ordenar y mostrar información a los usuarios. Por ejemplo, el campo de género le permite filtrar los resultados solo para grabaciones de jazz, la duración le ayuda a encontrar pistas dentro de un rango de duración específico y el nombre de archivo proporciona la ruta al archivo de audio real para su reproducción. upload_date puede ayudarlo a priorizar el contenido reciente o realizar un seguimiento de la actualización de los datos. Esta combinación de similitud semántica (de incrustaciones) y metadatos estructurados crea una poderosa experiencia de búsqueda.
Consultando sus vectores: la búsqueda k-NN recupera los k vectores más similares[2]:
vectorBucketName="audio-vectors", indexName="audio-embeddings", queryVector={"float32": query_embedding}, topK=10, # Devuelve los 10 resultados más similares returnDistance=True, returnMetadata=True ) para el resultado en respuesta["vectors"]: print(f"Clave: {resultado['key']}") print(f"Distancia: {resultado['distance']:.4f}") # Lower = más similar print(f"Metadata: {resultado['metadata']}")
Uso de Amazon OpenSearch Service: OpenSearch proporciona búsqueda k-NN nativa con índices HNSW (Hierarchical Navigable Small World) para una complejidad de tiempo de consulta sublineal[1]. Esto significa que sus búsquedas se mantienen rápidas incluso cuando su biblioteca de audio crece hasta alcanzar millones de archivos.
Configuración del índice:
"mappings": { "properties": { "audio_embedding": { "type": "knn_vector", "dimension": 1024, "method": { "name": "hnsw", "space_type": "cosinesimil", "engine": "nmslib", "parameters": {"ef_construction": 512, "m": 16} } }, "metadata": {"type": "objeto"} } } }
Optimización de lotes y patrones de producción
Por qué es importante el procesamiento por lotes: cuando procesa varios archivos de audio, la inferencia por lotes mejora el rendimiento al reducir la sobrecarga de latencia de la red[1]. En lugar de realizar llamadas API separadas para cada archivo, puede procesarlas de manera más eficiente.
Patrón de lote de ejemplo:
textos = ["música jazz", "música rock", "música clásica"] vectores =[]para texto en textos: respuesta = bedrock_runtime.invoke_model( body=json.dumps({ "taskType": "SINGLE_EMBEDDING", "singleEmbeddingParams": { "embeddingDimension": 1024, "text": {"truncationMode": "END", "value": text} } }), modelId="amazon.nova-2-multimodal-embeddings-v1:0", contentType="application/json" ) embedding = json.loads(respuesta["body"].read())["embeddings"][0]["embedding"] vectores.append(embedding) # Escritura por lotes en el almacén de vectores s3vectors.put_vectors( vectorBucketName="audio-vectors", indexName="audio-embeddings", vectores=[ {"key": f"text:{text}", "data": {"float32": emb}} para texto, emb en zip(texts, vectores) ] )
Soporte multilingüe: el modelo admite entradas de texto en más de 200 idiomas[1]. Esto admite poderosos escenarios de búsqueda intermodal: sus clientes pueden buscar en español contenido de audio indexado en inglés, o viceversa. Las incorporaciones capturan el significado semántico en todos los idiomas.
Análisis profundo de las incrustaciones multimodales de Amazon Nova Audio
Especificaciones técnicas
Arquitectura de modelo: Amazon Nova Multimodal Embeddings se basa en un modelo básico capacitado para comprender las relaciones entre diferentes modalidades (texto, imágenes, documentos, video y audio) dentro de un espacio de incrustación unificado.
Dimensiones de incrustación flexibles: obtiene cuatro opciones de dimensiones de salida: 3072, 1024, 384 y 256. Las dimensiones más grandes proporcionan representaciones más detalladas pero requieren más almacenamiento y cálculo. Las dimensiones más pequeñas ofrecen un equilibrio práctico entre el rendimiento de recuperación y la eficiencia de los recursos. Esta flexibilidad le ayuda a optimizar sus aplicaciones y requisitos de costos específicos.
Capacidades de procesamiento de medios: para entradas de video y audio, el modelo admite segmentos de hasta 30 segundos y segmenta automáticamente archivos más largos.[1]. Esta capacidad de segmentación es particularmente útil cuando se trabaja con archivos multimedia grandes: el modelo los divide en partes manejables y crea incrustaciones para cada segmento. El resultado incluye incrustaciones para sus archivos de video y audio con metadatos temporales.
Flexibilidad de API: puede acceder al modelo a través de API sincrónicas y asincrónicas. Utilice API síncronas para consultar dónde importa la latencia. Utilice API asincrónicas para la ingestión e indexación de datos donde pueda tolerar tiempos de procesamiento más prolongados. La API asíncrona admite la segmentación/fragmentación por lotes de archivos de texto, audio y vídeo. La segmentación se refiere a dividir un archivo largo en fragmentos más pequeños, cada uno de los cuales crea una incrustación única, lo que permite una recuperación más detallada y precisa.
Métodos de entrada: puede pasar contenido para incrustar especificando un URI de S3 o en línea como codificación base64. Esto le brinda flexibilidad a la hora de integrar incorporaciones en su flujo de trabajo.
Cómo funciona el flujo de trabajo:
Utiliza Amazon Nova Multimodal Embeddings para generar incrustaciones para sus clips de vídeo o audio. Almacena las incrustaciones en una base de datos vectorial. Cuando su usuario final busca contenido, utiliza Amazon Nova para generar una incrustación para su consulta de búsqueda. Su aplicación compara qué tan similar es la incrustación de la consulta de búsqueda con sus incrustaciones de contenido indexados. Su aplicación recupera el contenido que mejor coincide con la consulta de búsqueda basándose en una métrica de similitud (como la similitud de coseno). Muestra el contenido correspondiente a su usuario final
Entradas admitidas: sus entradas para generar incrustaciones pueden ser en formato de texto, imagen, imagen de documento, video o audio. Las entradas se refieren tanto a los elementos que utiliza para crear el índice como a las consultas de búsqueda del usuario final. El modelo genera incorporaciones que se utilizan para recuperar los activos que mejor coinciden con la consulta para mostrar al usuario final.
Compatibilidad con formatos de audio: Amazon Nova Multimodal Embedding actualmente admite mp3, wav y ogg como formatos de entrada. Estos formatos cubren los casos de uso de audio más comunes, desde música hasta grabaciones de voz.
Capacidades clave
Búsqueda de audio a audio: encuentre contenido acústicamente similar en su biblioteca. Por ejemplo, busque todas las grabaciones con características musicales o estilos de habla similares.
Búsqueda de texto a audio: utilice consultas en lenguaje natural para recuperar segmentos de audio relevantes. Busque "piano de jazz alegre" o "cliente expresando frustración" y obtenga clips de audio coincidentes.
Recuperación multimodal: busque en imágenes, audio, video y texto simultáneamente. Este enfoque unificado significa que puede utilizar una consulta para buscar en toda su biblioteca de contenido, independientemente del formato.
Comprensión temporal: el modelo reconoce acciones y eventos dentro del audio a lo largo del tiempo. Esto le permite buscar momentos específicos dentro de grabaciones largas.
Cuándo elegir Amazon Nova
Amazon Nova Multimodal Embeddings está diseñado para aplicaciones de producción que requieren rendimiento escalable, implementación rápida y gastos operativos mínimos.
Por qué elegir Amazon Nova:
Velocidad de comercialización: Implementación en horas o días, no meses Servicio administrado: No hay infraestructura que mantener ni modelos que entrenar Capacidades multimodales: Un modelo para todos sus tipos de contenido con soporte de implementación a nivel empresarial Mejoras continuas: Benefíciese de las actualizaciones del modelo sin trabajo de migración
Factores de decisión a considerar:
Requisitos de escala: ¿Cuántos archivos de audio y consultas necesita manejar? Tiempo de comercialización: ¿Con qué rapidez necesita una solución funcional? Disponibilidad de experiencia: ¿Tiene un equipo de ingeniería para mantener modelos personalizados? Necesidades de integración: ¿Necesita una integración perfecta de servicios de AWS?
Dominios de aplicaciones principales: Amazon Nova Multimodal Embeddings ofrece una amplia gama de aplicaciones optimizadas para RAG multimodal, búsqueda semántica y agrupación en clústeres:
Generación aumentada de recuperación agente (RAG): puede utilizar incrustaciones multimodales de Amazon Nova para aplicaciones basadas en RAG donde el modelo sirve como incrustación para la tarea de recuperación. Su entrada puede ser texto de documentos, imágenes o imágenes de documentos que intercalan texto con infografías, videos y audio. La incorporación le permite recuperar la información más relevante de su base de conocimientos que puede proporcionar a un sistema LLM para obtener respuestas mejoradas. Búsqueda semántica: puede generar incrustaciones de texto, imágenes, imágenes de documentos, video y audio para impulsar aplicaciones de búsqueda almacenadas en un índice vectorial. Un índice vectorial es un espacio de incrustación especializado que reduce la cantidad de comparaciones necesarias para obtener resultados efectivos. Debido a que el modelo captura los matices de la consulta del usuario dentro de la inserción, admite consultas de búsqueda avanzada que no dependen de la concordancia de palabras clave. Sus usuarios pueden buscar conceptos, no sólo palabras exactas. Agrupación en clústeres: puede utilizar Amazon Nova Multimodal Embeddings para generar incrustaciones de texto, imágenes, imágenes de documentos, vídeo y audio. Los algoritmos de agrupamiento pueden agrupar elementos que están cerca entre sí según la distancia o la similitud. Por ejemplo, si trabaja en la gestión de medios y desea categorizar sus recursos multimedia en temas similares, puede utilizar las incrustaciones para agrupar recursos similares sin necesidad de metadatos para cada recurso. El modelo comprende automáticamente la similitud del contenido.
Conclusión
En esta publicación, exploramos cómo Amazon Nova Multimodal Embeddings permite la comprensión semántica del audio más allá de los enfoques tradicionales basados en texto. Al representar el audio como vectores de alta dimensión que capturan propiedades acústicas y semánticas, puede crear sistemas de búsqueda que comprendan el tono, la emoción y el contexto, no solo las palabras habladas. Cubrimos el flujo de trabajo de un extremo a otro para crear un sistema de búsqueda de audio, que incluye: – Generación de incrustaciones utilizando API sincrónicas y asincrónicas – Segmentación de archivos de audio largos con metadatos temporales – Almacenamiento de incrustaciones en una base de datos vectorial – Realización de búsqueda k-NN para recuperar segmentos de audio relevantes. Este enfoque le permite transformar grandes bibliotecas de audio en conjuntos de datos inteligentes con capacidad de búsqueda que admiten casos de uso como análisis de centros de llamadas, búsqueda de medios y descubrimiento de contenido.
En nuestra implementación, tomamos un escenario del mundo real que incorpora grabaciones de centros de llamadas y utilizamos el modelo Amazon Nova Multimodal Embeddings para que se puedan buscar tanto por sentimiento como por contenido. En lugar de etiquetar llamadas manualmente, utilizamos consultas de texto como: "Encuentra una llamada en la que el hablante suena enojado" o "Muéstrame una conversación sobre problemas de facturación". Funcionó, sacando los clips de audio correctos a pedido. En otras palabras, convertimos los archivos de audio en una experiencia de búsqueda tanto por tono como por tema sin complicaciones. Para aquellos que quieran profundizar más, pueden ver nuestros ejemplos de código y fragmentos vinculados en la sección final.
Referencias
[1]Blog sobre incorporaciones multimodales de Amazon Nova
[2]Incrustaciones de Nova
[3]Regiones y modelos admitidos para inferencia por lotes