Creación de asistentes de voz en tiempo real con Amazon Nova Sonic en comparación con arquitecturas en cascada

Los agentes de IA de voz están remodelando la forma en que interactuamos con la tecnología. Desde servicio al cliente y asistencia sanitaria hasta automatización del hogar y productividad personal, estos asistentes virtuales inteligentes están ganando popularidad rápidamente en todas las industrias. Sus capacidades de lenguaje natural, disponibilidad constante y creciente sofisticación los convierten en herramientas valiosas para las empresas que buscan eficiencia y las personas que desean experiencias digitales perfectas.

Amazon Nova Sonic ofrece conversaciones de voz similares a las humanas en tiempo real a través de la interfaz de transmisión bidireccional. Entiende diferentes estilos de habla y genera respuestas expresivas que se adaptan tanto a las palabras pronunciadas como a la forma en que se pronuncian. El modelo admite varios idiomas y ofrece voces tanto masculinas como femeninas, lo que lo hace ideal para atención al cliente, llamadas de marketing, asistentes de voz y aplicaciones educativas.

En comparación con arquitecturas más nuevas como Amazon Nova Sonic, que combina la comprensión y la generación de voz en un único modelo de extremo a extremo, los sistemas clásicos de chat de voz con IA utilizan arquitecturas en cascada con procesamiento secuencial. Estos sistemas procesan el habla de un usuario a través de un canal distinto: el enfoque de modelos en cascada descompone el procesamiento de voz de IA en componentes separados:

Detección de actividad de voz (VAD): se requiere un VAD de preprocesamiento para detectar cuándo el usuario hace una pausa o deja de hablar. Voz a texto (STT): las palabras habladas del usuario se convierten a un formato de texto escrito mediante un modelo de reconocimiento automático de voz (ASR). Procesamiento de modelo de lenguaje grande (LLM): el texto transcrito luego se envía a un LLM o administrador de diálogo, que analiza la entrada y genera una respuesta textual relevante basada en el contexto de la conversación. Texto a voz (TTS): la respuesta basada en texto de la IA se vuelve a convertir en audio hablado con sonido natural mediante un modelo TTS, que luego se reproduce para el usuario.

El siguiente diagrama ilustra el flujo conceptual de cómo los usuarios interactúan con Nova Sonic para conversaciones de voz en tiempo real en comparación con una solución de asistente de voz en cascada.

Los principales desafíos de la arquitectura en cascada

Si bien una arquitectura en cascada ofrece beneficios como diseño modular, componentes especializados y capacidad de depuración, la latencia acumulativa y la interactividad reducida son sus desventajas.

El efecto cascada

Considere un asistente de voz que maneja una consulta meteorológica simple. En las canalizaciones en cascada, cada paso de procesamiento introduce latencia y posibles errores. Las implementaciones de los clientes mostraron cómo las malas interpretaciones iniciales pueden agravarse a lo largo del proceso, lo que a menudo resulta en respuestas irrelevantes. Este efecto en cascada complicó la resolución de problemas e impactó negativamente en la experiencia general del usuario.

el tiempo lo es todo

Las conversaciones reales requieren un ritmo natural. El procesamiento secuencial puede crear retrasos notables en los tiempos de respuesta. Estas interrupciones en el flujo conversacional pueden generar fricciones entre los usuarios.

El desafío de la integración

La IA de voz exige algo más que el procesamiento del habla: requiere patrones de interacción naturales. Los comentarios de los clientes destacaron cómo la orquestación de múltiples componentes dificultaba el manejo de elementos dinámicos de la conversación, como interrupciones o intercambios rápidos. Los recursos de ingeniería a menudo se centraban más en la gestión de tuberías.

Realidad de los recursos

Las arquitecturas en cascada requieren recursos informáticos, monitoreo y mantenimiento independientes para cada componente. Esta complejidad arquitectónica afecta tanto la velocidad de desarrollo como la eficiencia operativa. Los desafíos de escalamiento se intensifican a medida que aumentan los volúmenes de conversaciones, lo que afecta la confiabilidad del sistema y la optimización de costos.

Impacto en el desarrollo de asistentes de voz

Estos conocimientos impulsaron decisiones arquitectónicas clave en el desarrollo de Nova Sonic, abordando la necesidad fundamental de un procesamiento unificado de voz a voz que permita experiencias de voz naturales y receptivas sin la complejidad de la gestión de múltiples componentes.

Comparando los dos enfoques

Para comparar el enfoque de voz a voz y en cascada para crear agentes de IA de voz, considere lo siguiente:

Consideración Habla a voz (Nova Sonic) Modelos en cascada Latencia

Rendimiento de latencia optimizado y TTFA

Evaluamos el rendimiento de latencia del modelo Nova Sonic utilizando la métrica Time to First Audio (TTFA 1.09). TTFA mide el tiempo transcurrido desde que se completa la consulta hablada de un usuario hasta que se recibe el primer byte de audio de respuesta. Ver memoria técnica y ficha modelo.

Posibles errores y latencia añadida

Los modelos en cascada pueden utilizar múltiples modelos en reconocimiento de voz, comprensión del lenguaje y generación de voz, pero enfrentan el desafío de una latencia adicional y una posible propagación de errores entre etapas. Al utilizar marcos de orquestación asincrónicos modernos como Pipecat y LiveKit, puede minimizar la latencia. La transmisión de componentes y el uso de rellenos de texto a voz ayudan a mantener el flujo conversacional natural y reducir las demoras.

Complejidad de la arquitectura y el desarrollo.

Arquitectura simplificada

Nova Sonic combina voz a texto, comprensión del lenguaje natural y texto a voz en un único modelo con uso de herramientas integradas y detección de intrusiones, proporcionando una arquitectura basada en eventos para eventos clave de entrada y salida, y una API de transmisión bidireccional para una experiencia de desarrollador simplificada.

Complejidad potencial en la arquitectura.

Los desarrolladores deben seleccionar los mejores modelos de su clase para cada etapa del proceso, mientras organizan componentes adicionales, como canales asincrónicos para agentes delegados y uso de herramientas, rellenos de TTS y (VAD).

Selección y personalización del modelo.

Menos control sobre los componentes individuales.

Amazon Nova Sonic permite la personalización de voces, el uso de herramientas integradas y la integración con Amazon Bedrock Knowledge Bases y Amazon Bedrock AgentCore. Sin embargo, ofrece un control menos granular sobre los componentes individuales del modelo en comparación con los sistemas en cascada totalmente modulares.

Control granular potencial sobre cada paso

Los modelos en cascada brindan más control sobre cada paso al permitir el ajuste, reemplazo y optimización individuales de los componentes de cada modelo, como STT, comprensión del lenguaje y TTS de forma independiente. Esto incluye modelos de Amazon Bedrock Marketplace, Amazon SageMaker AI y modelos optimizados. Esta modularidad permite la selección y flexibilidad de modelos, lo que lo hace ideal para capacidades complejas o especializadas que requieren un rendimiento personalizado.

Estructura de costos

Estructura de costos simplificada a través de un enfoque integrado

El precio de Amazon Nova Sonic se basa en un modelo de consumo basado en tokens.

Complejidad potencial en los costos asociados con múltiples componentes

Los modelos en cascada constan de múltiples componentes cuyos costos deben estimarse. Esto es especialmente importante a escala y con grandes volúmenes.

Compatibilidad con idiomas y acentos Idiomas admitidos por Nova Sonic Posible soporte de idiomas más amplio a través de modelos especializados, incluida la capacidad de cambiar de idioma en mitad de una conversación Disponibilidad de región Regiones admitidas por Nova Sonic Posible soporte regional más amplio debido a la amplia selección de modelos y la capacidad de autohospedar modelos en Amazon Elastic Kubernetes Service (Amazon EKS) o Amazon SageMaker.

Los dos enfoques también tienen algunos rasgos compartidos.

Opciones de telefonía y transporte Tanto los enfoques en cascada como los de voz a voz admiten una variedad de protocolos de telefonía y transporte, como WebRTC y WebSocket, lo que permite la transmisión de audio en tiempo real y de baja latencia a través de la web y las redes telefónicas. Estos protocolos facilitan un intercambio de audio bidireccional fluido, crucial para experiencias conversacionales naturales, permitiendo que los sistemas de inteligencia artificial de voz se integren fácilmente con las infraestructuras de comunicación existentes mientras mantienen la capacidad de respuesta y la calidad del audio. Evaluaciones, observabilidad y pruebas Tanto los enfoques de IA de voz en cascada como los de voz a voz pueden evaluarse, observarse y probarse sistemáticamente para realizar comparaciones confiables. Se recomienda invertir en un sistema de evaluación y observabilidad de IA de voz para ganar confianza en la precisión y el rendimiento de la producción. Un sistema de este tipo debería ser capaz de rastrear todo el proceso de entrada a salida, capturar métricas y datos de conversación de un extremo a otro para evaluar de manera integral la calidad, la latencia y la solidez de la conversación a lo largo del tiempo. Marcos de desarrollo Tanto los enfoques en cascada como los de voz a voz están bien respaldados por los principales marcos de inteligencia artificial de voz de código abierto, como Pipecat y LiveKit. Estos marcos proporcionan canalizaciones modulares y flexibles y capacidades de procesamiento en tiempo real que los desarrolladores pueden utilizar para crear, personalizar y orquestar modelos de inteligencia artificial de voz de manera eficiente en diferentes componentes y estilos de interacción.

Cuándo utilizar cada enfoque

El siguiente diagrama muestra un marco práctico para guiar su decisión arquitectónica:

Árbol de decisión

Utilice el habla a voz cuando:

La simplicidad de la implementación es importante. El caso de uso se ajusta a las capacidades de Nova Sonic. Está buscando una experiencia de chat en tiempo real que se sienta humana y ofrezca baja latencia.

Utilice modelos en cascada cuando:

Se requiere la personalización de componentes individuales. Necesita utilizar modelos especializados de Amazon Bedrock Marketplace, Amazon SageMaker AI o modelos ajustados para su dominio específico. Necesita soporte para idiomas o acentos no cubiertos por Nova Sonic. El caso de uso requiere procesamiento especializado en etapas específicas.

Conclusión

En esta publicación, aprendió cómo Amazon Nova Sonic está diseñado para resolver algunos de los desafíos que enfrentan los enfoques en cascada, simplificar la creación de agentes de inteligencia artificial de voz y brindar capacidades de conversación naturales. También brindamos orientación sobre cuándo elegir cada enfoque para ayudarlo a tomar decisiones informadas para sus proyectos de IA de voz. Si está buscando mejorar su sistema de voz en cascada, sabe que tiene los conceptos básicos sobre cómo migrar a Nova Sonic para poder ofrecer experiencias de conversación fluidas y en tiempo real con una arquitectura simplificada.

Para obtener más información, consulte Amazon Nova Sonic y comuníquese con su equipo de cuentas para explorar cómo puede acelerar sus iniciativas de inteligencia artificial de voz.

Recursos

Sobre los autores

Daniel Wirjo es arquitecto de soluciones en AWS, enfocado en startups de IA y SaaS. Como ex director de tecnología de una startup, le gusta colaborar con fundadores y líderes de ingeniería para impulsar el crecimiento y la innovación en AWS. Fuera del trabajo, Daniel disfruta caminar con un café en la mano, apreciar la naturaleza y aprender nuevas ideas.

Ravi Thakur es arquitecto senior de soluciones en AWS con sede en Charlotte, Carolina del Norte. Tiene experiencia en múltiples industrias, como comercio minorista, servicios financieros, atención médica y energía y servicios públicos, y se especializa en resolver desafíos comerciales complejos utilizando patrones de nube bien diseñados. Su experiencia abarca microservicios, arquitecturas nativas de la nube e inteligencia artificial generativa. Fuera del trabajo, Ravi disfruta de los paseos en motocicleta y las escapadas familiares.

Lana Zhang es arquitecta senior especializada en soluciones para IA generativa en AWS dentro de la Organización Mundial de Especialistas. Se especializa en IA/ML, con especial atención en casos de uso como asistentes de voz de IA y comprensión multimodal. Trabaja en estrecha colaboración con clientes de diversas industrias, incluidos los medios y el entretenimiento, los juegos, los deportes, la publicidad, los servicios financieros y la atención médica, para ayudarlos a transformar sus soluciones comerciales a través de la IA.