Esta publicación está coescrita por el Instituto de Ciência e Tecnologia Itaú (ICTi) y AWS.
El análisis de sentimientos se ha vuelto cada vez más importante en las empresas modernas, ya que proporciona información sobre las opiniones de los clientes, los niveles de satisfacción y las posibles frustraciones. Dado que las interacciones se producen en gran medida a través de texto (como redes sociales, aplicaciones de chat y reseñas de comercio electrónico) o voz (como centros de llamadas y telefonía), las organizaciones necesitan métodos sólidos para interpretar estas señales a escala. Al identificar y clasificar con precisión el estado emocional de un cliente, las empresas pueden ofrecer experiencias más proactivas y personalizadas, lo que impacta positivamente en la satisfacción y lealtad del cliente.
A pesar de su valor estratégico, la implementación de soluciones integrales de análisis de sentimiento presenta varios desafíos. La ambigüedad del lenguaje, los matices culturales, los dialectos regionales, las expresiones sarcásticas y los grandes volúmenes de datos en tiempo real exigen arquitecturas escalables y flexibles. Además, en el análisis de sentimientos basado en la voz, características críticas como la entonación y la prosodia pueden perderse si el audio se transcribe y se trata únicamente como texto. Amazon Web Services (AWS) ofrece un conjunto de herramientas para abordar estos desafíos. AWS ofrece servicios que van desde captura y transcripción de audio (Amazon Transcribe) hasta clasificación de opiniones de texto (Amazon Comprehend), así como soluciones de centros de contacto inteligentes (Amazon Connect) y transmisión de datos en tiempo real (Amazon Kinesis).
Esta publicación, desarrollada a través de una asociación científica estratégica entre AWS y el Instituto de Ciência e Tecnologia Itaú (ICTi), centro de investigación y desarrollo mantenido por Itaú Unibanco, el banco privado más grande de América Latina, explora los aspectos técnicos del análisis de sentimiento tanto para texto como para audio. Presentamos experimentos que comparan múltiples modelos y servicios de aprendizaje automático (ML), analizamos las ventajas y desventajas de cada enfoque y destacamos cómo se pueden orquestar los servicios de AWS para crear soluciones sólidas de extremo a extremo. También ofrecemos información sobre posibles direcciones futuras, incluida una ingeniería rápida más avanzada para modelos de lenguaje grandes (LLM) y la ampliación del alcance del análisis basado en audio para capturar señales emocionales que los datos de texto por sí solos podrían pasar por alto. Exploramos el análisis de sentimientos basado en audio en dos etapas:
Etapa 1: transcribir audio a texto y realizar análisis de opiniones utilizando LLM. Etapa 2: analizar opiniones directamente desde la señal de audio utilizando modelos de audio.
Análisis de sentimiento en texto.
En esta sección, analizamos el método para transcribir audio a texto y realizar análisis de sentimientos utilizando LLMS.
Retos y características
Este método presenta los siguientes desafíos:
Variedad de fuentes de datos: las interacciones textuales surgen de numerosos canales (redes sociales, plataformas de comercio electrónico, chatbots y tickets de asistencia técnica), cada uno con formatos y limitaciones únicos. Por ejemplo, el texto de las redes sociales puede contener hashtags, emojis o límites de caracteres, mientras que los mensajes de chat pueden incluir acrónimos y jerga específica del dominio. Por lo tanto, un proceso de procesamiento de texto sólido debe incluir pasos adecuados de preprocesamiento y limpieza de datos para normalizar estas variaciones. Ambigüedad del lenguaje natural: el lenguaje humano suele ser ambiguo y depende del contexto. El sarcasmo, la ironía y las expresiones figurativas complican la clasificación mediante técnicas superficiales de procesamiento del lenguaje natural (PNL). Aunque las redes neuronales profundas, como las arquitecturas basadas en BERT, RoBERTa y Transformers, han demostrado ser más hábiles en capturar semántica matizada, sigue siendo un desafío continuo tener en cuenta completamente el uso del lenguaje creativo o dependiente del contexto. Consideraciones multilingües y dialectales: empresas globales como Itaú Unibanco encuentran múltiples idiomas y dialectos regionales, cada uno de los cuales requiere modelos especializados o datos de capacitación adicionales. Un modelo de sentimiento entrenado principalmente en un idioma o dialecto puede fallar cuando se enfrenta a jergas, coloquialismos o estructuras gramaticales distintivas de otro.
Modelos probados y justificación.
En nuestros experimentos, evaluamos varios LLM con un enfoque en la clasificación de sentimientos. Entre ellos se encontraban modelos de base (FM) populares disponibles a través de Amazon Bedrock y Amazon SageMaker JumpStart, como Meta's Llama 3 70B, Claude 3.5 Sonnet de Anthropic, Mixtral 8x7B de Mistral AI y Amazon Nova Pro. Cada servicio ofrece ventajas únicas basadas en necesidades específicas. Por ejemplo, Amazon Bedrock simplifica la experimentación a gran escala al proporcionar una interfaz unificada y sin servidor para múltiples proveedores de LLM a través de acceso basado en API. SageMaker AI proporciona una experiencia administrada de servidor para acceder a FM populares con una interfaz de usuario fácil de usar o una implementación y administración basada en API. Tanto Amazon Bedrock como SageMaker AI agilizan preocupaciones operativas como el alojamiento de modelos, la escalabilidad, la seguridad y la optimización de costos, beneficios clave para la adopción empresarial de la IA generativa.
Probamos cada modelo en dos configuraciones:
Indicaciones de disparo cero o de pocas tomas: uso de indicaciones genéricas para clasificar sentimientos en el texto. Ajuste fino: adaptación del modelo en datos de sentimientos específicos del dominio para evaluar si esta capacitación especializada mejoró el rendimiento o corría el riesgo de un sobreajuste.
Servicios de AWS para análisis de texto
Amazon ofrece un conjunto de servicios para ayudar a agilizar el proceso de análisis de texto. Para esta publicación, utilizamos los siguientes servicios para crear un servicio de análisis de texto:
Amazon Bedrock: facilita el acceso sin servidor a FM previamente capacitados de diferentes proveedores dentro de una interfaz única y segura, en particular el acceso a modelos de pesas cerradas como Claude de Anthropic. Esto permite realizar pruebas rápidas de múltiples modelos sin administrar la infraestructura subyacente. Amazon SageMaker AI: brinda acceso a los últimos FM de código abierto como Llama, Mistral, DeepSeek y más. Con SageMaker AI, tiene la opción de simplificar la implementación de FM utilizando Amazon SageMaker JumpStart, un centro administrado de ML e IA generativa que proporciona una implementación simple basada en UI o API de cientos de FM o, alternativamente, lo ayuda a implementar su FM y arquitectura preferidos en la infraestructura de GPU NVIDIA administrada con facilidad. Amazon Comprehend: un servicio de inteligencia artificial con capacidades de análisis de texto que incluyen análisis de sentimientos, reconocimiento de entidades y modelado de temas. Puede servir como base o integrarse con flujos de trabajo avanzados de LLM para lograr un proceso más completo. Amazon Kinesis: maneja la ingestión y transmisión en tiempo real de datos de texto de diversas fuentes (como fuentes de redes sociales, secuencias de registros o sesiones de chat de clientes en tiempo real).
Una arquitectura simplificada podría constar de los siguientes componentes:
Ingesta de datos mediante Kinesis para capturar texto de diversas fuentes. Preprocesamiento de datos mediante AWS Lambda o Amazon EMR para normalización, tokenización y filtrado. Inferencia de modelos utilizando un LLM al que se accede a través de Amazon Bedrock o SageMaker AI Storage y análisis en Amazon Simple Storage Service (Amazon S3) o Amazon Redshift para análisis, informes y visualización a largo plazo.
Resultados experimentales para texto.
La siguiente tabla resume las métricas de rendimiento (exactitud, precisión, recuperación) en los diferentes modelos probados. Cada uno fue evaluado en el mismo conjunto de datos de texto con el objetivo de clasificar oraciones como positivas, negativas o neutrales.
Modelo Exactitud Precisión Recuperación Amazon SageMaker JumpStart Llama 3 70B Instruct v1 0,189 0,527 0,189 Amazon Bedrock Anthropic Claude 3.5 Sonnet 2024-06-20-v1 0,187 0,44 0,187 Amazon SageMaker Mixtral 8x7B Instruct v0 0,164 0,545 0,164 Amazon Bedrock Amazon Nova Pro v1 0,159 0,239 0,16 LLM 1 de última generación de código cerrado (>50 B) 0,159 0,025 0,159 LLM 2 de última generación de código cerrado (>50 B) 0,159 0,025 0,159
Análisis de hallazgos
Observamos lo siguiente a partir de nuestros resultados:
Bajo rendimiento general: todos los modelos muestran una precisión relativamente baja en la detección de la polaridad del sentimiento. Esto sugiere que las entradas puramente basadas en texto podrían no proporcionar suficientes señales contextuales o emocionales, especialmente para expresiones más sutiles como el sarcasmo o la ironía. Impacto del ajuste: los dos modelos OpenAI ajustados lograron métricas más altas que la mayoría de las otras configuraciones, aunque el salto en el rendimiento podría indicar un sobreajuste. Consistentemente etiquetaron oraciones como no neutrales solo cuando estaba presente un fuerte indicador emocional. Variación del modelo: Llama 3 70B de Meta y Claude 3.5 Sonnet de Anthropic funcionaron mejor que otros modelos base, pero aún por debajo de las soluciones OpenAI afinadas. Esto podría reflejar sus objetivos previos al entrenamiento y las diferencias de dominio entre sus datos de entrenamiento originales y nuestra tarea de clasificación de sentimientos.
Direcciones futuras para el análisis basado en texto
Podría considerar ampliar su análisis basado en texto de las siguientes maneras:
Ingeniería de indicaciones avanzada: los experimentos actuales emplearon indicaciones sencillas de cadena de pensamiento. El trabajo futuro podría explorar diseños de indicaciones más refinadas de pocos intentos o de cero intentos, incluidas estrategias de razonamiento avanzadas como "amortiguador de pensamientos" o indicaciones de dominios específicos cuidadosamente dirigidas. Entradas multimodales: la incorporación de información paralingüística (como la entonación o el énfasis del hablante) podría impulsar la clasificación basada en texto. Dichos datos podrían codificarse como metadatos o extraerse mediante modelos auxiliares para enriquecer el contexto textual. Cobertura de idiomas: extenderse a corpus que no están en inglés y entrenar modelos multilingües o de dominios específicos probablemente mejoraría la generalización en implementaciones del mundo real.
Análisis de sentimiento en audio.
En esta sección, analizamos el método de analizar el sentimiento directamente desde la señal de audio utilizando modelos de audio.
Retos y características
Este método presenta los siguientes desafíos:
Entonación y prosodia: el lenguaje hablado conlleva señales acústicas (tono, tono, volumen, tempo y ritmo) que influyen en gran medida en el sentimiento percibido. Un simple saludo como “Hola, ¿cómo estás?” Puede ser genuinamente entusiasta o pasivamente sarcástico, dependiendo de la entonación. Los canales tradicionales de conversión de voz a texto descartan estas señales no verbales, lo que potencialmente debilita la señal de sentimiento. Conversión de voz a texto: muchos sistemas de análisis de opiniones de audio se basan en ASR (reconocimiento automático de voz) para generar transcripciones, que luego se introducen en modelos de opiniones basados en texto. Aunque es beneficioso para la comprensión del contenido, el análisis puramente textual ignora las características prosódicas, una de las razones por las que la clasificación directa de sentimientos basada en audio ha despertado interés en la investigación. Ruido y calidad de grabación: el audio del mundo real a menudo contiene ruido de fondo, diálogos superpuestos o grabaciones de baja fidelidad. Los modelos deben ser resistentes a tales condiciones para que sean viables en entornos como centros de llamadas o líneas de atención al cliente.
Conjuntos de datos experimentales
Utilizamos dos tipos distintos de conjuntos de datos, cada uno de los cuales se centra en diferentes aspectos de la emoción en el habla:
Tipo 1: una colección seleccionada de declaraciones breves grabadas con diferentes entonaciones emocionales. Inicialmente etiquetados por excitación (como feliz, enojado, disgustado), los datos fueron luego reetiquetados por valencia (positiva, negativa, neutral). Se eliminaron las grabaciones etiquetadas como “sorpresa” porque puede manifestarse de forma positiva o negativa. Tipo 2: contiene oraciones más variadas, cada una etiquetada como positiva, negativa o neutral. La diversidad y complejidad de las expresiones hacen que este conjunto de datos sea significativamente más desafiante.
Modelos probados y justificación.
Evaluamos tres modelos destacados basados en el habla:
HuBERT (Unidad oculta BERT): emplea un transformador autosupervisado que aprende asignaciones de grupos ocultos en la señal de audio. HuBERT se destaca en la captura de patrones prosódicos y acústicos cruciales para la detección de emociones. Wav2Vec: similar en filosofía a HuBERT, Wav2Vec aprende representaciones poderosas directamente del audio sin procesar utilizando una columna vertebral de codificador Transformer. Su plan de formación autosupervisado es muy eficaz con datos etiquetados limitados. Whisper: un codificador-decodificador basado en Transformer diseñado originalmente para un reconocimiento de voz sólido. Aunque su énfasis está en la transcripción y la traducción, probamos su capacidad para extraer incrustaciones para tareas posteriores de clasificación de sentimientos.
Servicios de AWS para análisis de audio
Para optimizar el proceso de capacitación e inferencia, utilizamos los siguientes servicios de AWS:
Amazon SageMaker Studio: permite una configuración rápida de trabajos de capacitación en instancias diseñadas específicamente (por ejemplo, habilitadas para GPU) sin una sobrecarga significativa de infraestructura. Cada modelo (HuBERT, Wav2Vec, Whisper) fue entrenado y validado en sesiones separadas de SageMaker. Amazon Transcribe: para aquellos flujos de trabajo que requieren conversión de voz a texto, Amazon Transcribe proporciona ASR escalable y preciso. Aunque no es el foco de los métodos de sentimiento directos basados en audio, comúnmente se integra en las arquitecturas de los centros de contacto, donde las transcripciones de texto también se utilizan para análisis o verificaciones de cumplimiento.
Una arquitectura representativa podría incluir Kinesis para la ingestión de audio, Lambda para orquestar el preprocesamiento o la selección de rutas (como sentimiento directo basado en audio versus texto después de la transcripción) y Amazon S3 para almacenar los resultados finales. El siguiente diagrama ilustra esta arquitectura de ejemplo.
Resultados experimentales para audio.
Nuestra evaluación consideró la precisión de la clasificación en divisiones de prueba separadas para conjuntos de datos de Tipo 1 y Tipo 2. En general, los tres modelos lograron un mayor rendimiento en el Tipo 1 que en el Tipo 2. La siguiente tabla resume estos resultados.
Tipo de conjunto de datos Sentimiento Wav2Vec Hubert Whisper Recuperación de precisión Precisión F1 Recuperación de precisión Precisión F1 Recuperación de precisión Precisión F1 Tipo 1: Frases fijas Negativo 0,85 0,82 0,83 0,78 0,94 0,83 0,88 0,84 0,98 0,89 0,93 0,91 Tipo 1: Fijo Frases Neutras 0,57 0,95 0,72 0,61 0,98 0,75 0,8 0,96 0,87 Tipo 1: Frases Fijas Positivas 0,86 0,49 0,63 0,84 0,74 0,79 0,82 0,92 0,86 Tipo 2: Frases Variables Negativas 0,55 0,39 0,46 0,54 0,56 0,37 0,42 0,55 0,6 0,46 0,52 0,58 Tipo 2: Frases variables Neutro 0,59 0,73 0,65 0,6 0,74 0,66 0,63 0,71 0,67 Tipo 2: Frases variables Positivas 0,35 0,31 0,33 0,38 0,35 0,36 0,44 0,47 0,46
Análisis de hallazgos
Observamos lo siguiente a partir de nuestros resultados:
Tipo 1: debido a que las mismas frases se repetían con diferentes entonaciones emocionales, los modelos se centraron más en las señales acústicas que en el contenido. Esto condujo a una mayor precisión, especialmente al distinguir los estados de alta excitación (ira, excitación) de los de baja excitación (tristeza, calma). Tipo 2: el rendimiento disminuyó significativamente al enfrentarse a sentencias más variadas. Aquí, las diferencias en el contenido léxico y el contexto eclipsaron las características puramente prosódicas. Los modelos tuvieron dificultades para generalizar a través de diversas estructuras de oraciones, estilos de hablantes y expresiones emocionales.
Direcciones futuras para el análisis basado en audio
Podría considerar ampliar su análisis basado en texto de las siguientes maneras:
Diversidad de datos: ampliar los conjuntos de datos para incluir más idiomas, acentos regionales y condiciones ambientales podría mejorar la generalización de estos modelos. Fusión multimodal: la combinación de incrustaciones de audio directas (prosodia, entonación) con análisis textual (contenido léxico) podría generar representaciones de sentimientos más ricas. Esto es especialmente pertinente en escenarios de servicio al cliente donde tanto el contenido semántico como el tono emocional son importantes. Inferencia en tiempo real: para aplicaciones como el soporte de centros de contacto en vivo que utilizan Amazon Connect, los canales de inferencia en tiempo real son cruciales. Los investigadores pueden investigar métodos como la inferencia de modelos basada en transmisión (por ejemplo, procesamiento fragmento por fragmento o a nivel de fotograma) para obtener comentarios inmediatos sobre la opinión del cliente y adaptar las respuestas en consecuencia.
Conclusión
El análisis de sentimientos, ya sea realizado en texto o audio, ofrece información valiosa sobre las percepciones de los clientes, lo que permite estrategias de participación más proactivas y empáticas. Sin embargo, los obstáculos técnicos no son triviales:
Texto: la ambigüedad, la ironía y el contexto limitado pueden dificultar la clasificación basada exclusivamente en texto. Los LLM, incluso aquellos perfeccionados, pueden tener un rendimiento inferior sin una cuidadosa selección de datos, ingeniería avanzada y metadatos adicionales. Audio: el análisis directo del audio captura señales prosódicas y acústicas que a menudo se pierden en la transcripción. Sin embargo, el ruido ambiental, la superposición del habla y la diversidad de hablantes complican el entrenamiento de modelos robustos.
AWS proporciona un amplio conjunto de servicios que cubren el proceso de análisis de opiniones de un extremo a otro:
Ingestión de datos: Kinesis para transmisión de texto y audio en tiempo real Preprocesamiento: Lambda y Amazon EMR para limpieza de datos, extracción de características y transformaciones Transcripción (opcional): Amazon Transcribe para convertir audio en texto si se necesita un enfoque combinado de texto y audio Clasificación de sentimiento: AWS ofrece lo siguiente: Texto: Amazon Comprehend o FM a los que se accede a través de Amazon Bedrock y SageMaker AI Audio: modelos personalizados (como HuBERT, Wav2Vec, Whisper) entrenados en SageMaker AI Compromiso con el cliente: Amazon Connect para centros de contacto inteligentes con potencial para ciclos de retroalimentación de opiniones en tiempo real
En última instancia, la elección entre enfoques basados en audio, texto o híbridos depende del caso de uso y de los datos disponibles. Los métodos directos basados en audio pueden capturar sutilezas emocionales cruciales en las interacciones de los centros de llamadas, particularmente durante saludos o conversaciones muy cargadas, mientras que los métodos basados en texto suelen ser más sencillos de implementar a escala para chats, redes sociales y análisis basados en reseñas. Al utilizar las capacidades basadas en la nube de AWS junto con rigurosas metodologías de aprendizaje automático, las empresas pueden personalizar soluciones de análisis de sentimientos que equilibren la precisión, la escalabilidad y la rentabilidad. Las exploraciones futuras podrían integrar aún más flujos multimodales, ingeniería rápida avanzada y ajustes específicos de dominio, refinando continuamente nuestra capacidad para interpretar y actuar según la "voz del cliente".
Sobre los autores
Caique de Almeida es Staff Data Scientist del Instituto de Ciencia y Tecnología (ICTI) de Itaú. Se centra en el procesamiento del lenguaje natural, el aprendizaje profundo y la arquitectura de la nube, uniendo la investigación aplicada con los sistemas de inteligencia artificial de grado de producción. Posee 11 certificaciones de AWS y aplica esa experiencia en la nube para crear soluciones de IA escalables y confiables. Su trabajo actual se centra en la creación de agentes de servicios financieros orientados al cliente, la aplicación de la IA en las finanzas y la investigación de la factualidad y el razonamiento en la IA generativa. Fuera del trabajo, le gusta andar en bicicleta.
Guilherme Rinaldo es ingeniero e investigador de IA en el Instituto de Ciência e Tecnologia Itaú (ICTI), donde construye y evalúa sistemas de IA generativa para texto y voz, incluidos agentes basados en LLM y modelos de aprendizaje profundo. Con 8 años de experiencia, ha liderado trabajos desde prototipos de investigación hasta procesos de producción, con énfasis en confiabilidad, seguridad y evaluación rigurosa. Sus intereses incluyen el aprendizaje continuo, los agentes que evolucionan automáticamente y el seguimiento de modelos a escala. Fuera del trabajo, a Guilherme le gusta escribir, viajar y jugar juegos de estrategia. Puedes encontrar a Guilherme en LinkedIn.
Paulo Finardi es científico de datos principal del Instituto de Ciencia y Tecnología (ICTI) de Itaú. Tiene más de 10 años de experiencia en aprendizaje profundo y procesamiento de lenguaje natural, con enfoque en IA aplicada a finanzas, simulaciones y gemelos digitales. Su trabajo abarca la investigación aplicada a gran escala, así como la estrategia y la innovación en IA. Fuera del trabajo, le gusta andar en bicicleta. Puedes encontrar a Finardi en LinkedIn.
Víctor Costa Beraldo es científico de datos líder en el Instituto de Ciencia y Tecnología (ICTi) de Itaú y trabaja en la intersección de voz e inteligencia artificial. Con una sólida experiencia en procesamiento de señales y aprendizaje profundo, se centra en soluciones basadas en el habla, incluidos ASR, ASV, reconocimiento de emociones y procesamiento de audio en tiempo real, uniendo la investigación aplicada y los sistemas de producción en servicios financieros. Fuera del trabajo, le gusta ver partidos de fútbol. Puedes encontrar a Víctor en LinkedIn.
Vinicius Caridá es Científico de Datos Distinguido de Itaú Unibanco y miembro del comité científico y técnico del Instituto de Ciencia y Tecnología (ICTI) de Itaú. Trabaja en IA generativa, procesamiento de lenguaje natural, asistentes virtuales, sistemas de recomendación, sistemas de control y el ciclo de vida de MLOps de un extremo a otro. Vinicius tiene el honor de ser reconocido como AWS AI Hero y representa con orgullo a América Latina en el programa. Su trabajo actual se centra en crear agentes de inteligencia artificial orientados al cliente para servicios financieros y en promover la factualidad y el razonamiento en modelos generativos. Fuera del trabajo, le encanta enseñar y aprender con la comunidad tecnológica y pasar tiempo con su esposa Jerusa y su hija Olivia. Puedes encontrar a Vinicius en LinkedIn.
Pranav Murthy es científico senior de datos de IA generativa en AWS y se especializa en ayudar a las organizaciones a innovar con IA generativa, aprendizaje profundo y aprendizaje automático en Amazon SageMaker AI. Durante los últimos 10 años, ha desarrollado y ampliado modelos avanzados de visión por computadora (CV) y procesamiento de lenguaje natural (NLP) para abordar problemas de alto impacto, desde la optimización de las cadenas de suministro globales hasta permitir el análisis de video en tiempo real y la búsqueda multilingüe. Puedes encontrar Pranav en LinkedIn.