OpenAI lanzó tres nuevos modelos de audio a través de su API en tiempo real, cada uno de los cuales apunta a una capacidad distinta en aplicaciones de voz en vivo: GPT-Realtime-2 para agentes de voz con razonamiento, GPT-Realtime-Translate para traducción de voz en vivo y GPT-Realtime-Whisper para transcripción en streaming. Junto con los lanzamientos de modelos, la API en tiempo real sale oficialmente de la versión beta y ahora está disponible de forma generalizada, una señal significativa para los desarrolladores que postergaron la creación de sistemas de producción en ella. Los tres modelos están disponibles inmediatamente a través de la API de OpenAI y se pueden probar en Playground.
Juntos, impulsan las aplicaciones de voz más allá del ciclo básico de preguntas y respuestas, hacia sistemas que pueden escuchar, razonar, traducir, transcribir y actuar dentro de una sola conversación.
GPT-Realtime-2: razonamiento de voz con una ventana de contexto de 128K
El lanzamiento insignia es GPT-Realtime-2, que el equipo de OpenAI describe como su primer modelo de voz con razonamiento de clase GPT-5. GPT-Realtime-2 puede procesar solicitudes más difíciles, gestionar interrupciones y continuar las conversaciones de forma natural. OpenAI amplió la ventana de contexto del modelo de 32.000 a 128.000 tokens, lo que permitió conversaciones más largas y tareas más complejas sin perder el contexto.
Los modelos de voz anteriores con frecuencia se estancaban en solicitudes de varios pasos o abandonaban el contexto anterior durante sesiones más largas. GPT-Realtime-2 está diseñado específicamente para mantener la conversación en movimiento mientras se razona una solicitud.
Los desarrolladores pueden habilitar frases breves de preámbulo, como “déjame comprobar eso” o “un momento mientras lo reviso”, para que los usuarios sepan que el agente está trabajando en la solicitud. El modelo también puede llamar a varias herramientas a la vez y narrar lo que hace mientras lo hace, de modo que en lugar de aire muerto durante una tarea de varios pasos, el usuario recibe un comentario continuo. Estas características abordan directamente uno de los modos de falla más comunes en los agentes de voz implementados: un silencio incómodo que hace que el sistema parezca roto.
Un control particularmente útil para los constructores de producción es el esfuerzo de razonamiento ajustable. Los desarrolladores pueden ajustar la intensidad del razonamiento en cinco niveles: mínimo, bajo, medio, alto y alto. El valor predeterminado es “bajo” para mantener baja la latencia para solicitudes simples, mientras que las tareas más difíciles pueden aprovechar más computación. Esto significa que los equipos pueden ajustar la compensación entre rendimiento y latencia a nivel de sesión según el caso de uso: una búsqueda rápida de clientes no necesita la misma profundidad de razonamiento que un flujo de trabajo de reserva de viajes de varios pasos.
GPT-Realtime-2 también agrega control de tono. El modelo puede ajustar su estilo de hablar dependiendo de la situación: mantener la calma durante la resolución de problemas, volverse empático cuando los usuarios están frustrados y volverse optimista después de un resultado exitoso. El modelo también comprende mejor la terminología específica de la industria, incluido el vocabulario de atención médica y los nombres propios.
En los puntos de referencia, las ganancias son mensurables. GPT-Realtime-2 con razonamiento alto obtuvo una puntuación del 96,6 % en Big Bench Audio, en comparación con el 81,4 % de GPT-Realtime-1.5, una mejora de 15,2 puntos porcentuales. GPT-Realtime-2 con razonamiento xhigh obtuvo una puntuación del 48,5 % en el seguimiento de instrucciones de Audio MultiChallenge, en comparación con el 34,7 % de GPT-Realtime-1.5.
Big Bench Audio evalúa capacidades de razonamiento desafiantes en modelos de lenguaje que admiten entrada de audio. Audio MultiChallenge evalúa la inteligencia conversacional de múltiples turnos en sistemas de diálogo hablado, incluido el seguimiento de instrucciones, la integración del contexto, la autoconsistencia y el manejo de correcciones naturales del habla.
Precio: GPT-Realtime-2 tiene un precio de $32 por 1 millón de tokens de entrada de audio ($0,40 por tokens de entrada en caché) y $64 por 1 millón de tokens de salida de audio.
GPT-Realtime-Translate: traducción de voz en vivo en más de 70 idiomas
GPT-Realtime-Translate es un nuevo modelo de traducción en vivo que traduce voz de más de 70 idiomas de entrada a 13 idiomas de salida mientras sigue el ritmo del hablante. A diferencia de GPT-Realtime-2, este modelo es un canal de traducción dedicado: el habla va en un idioma y sale en otro. No es un agente conversacional; está diseñado para convertir una transmisión de audio en otra en tiempo real.
La distinción es importante para que los desarrolladores elijan la herramienta adecuada. Si su aplicación necesita un flujo de atención al cliente bilingüe o un intérprete en vivo para un evento en persona, GPT-Realtime-Translate es la opción diseñada específicamente. Si necesita que el modelo también razone, llame a funciones o mantenga el contexto durante los turnos, GPT-Realtime-2 se encarga de eso.
Precios: GPT-Realtime-Translate tiene un precio de 0,034 dólares por minuto.
GPT-Realtime-Whisper: transmisión de transcripción mientras la gente habla
GPT-Realtime-Whisper es un nuevo modelo de transmisión de voz a texto creado para conversión de voz a texto de baja latencia: transcribe audio mientras las personas hablan, para que los productos en vivo puedan parecer más rápidos, con mayor capacidad de respuesta y más naturales.
El modelo Whisper original fue diseñado para fragmentos de audio completos, lo que lo hace más adecuado para la transcripción posterior a la sesión. GPT-Realtime-Whisper es la contraparte de transmisión, diseñada específicamente para aplicaciones que necesitan salida en vivo. Para la transcripción en tiempo real, gpt-realtime-whisper le brinda una latencia controlable: las configuraciones de demora más bajas producen texto parcial más temprano, mientras que las configuraciones de demora más altas pueden mejorar la calidad de la transcripción.
Los casos de uso incluyen subtítulos de transmisiones en vivo, notas de reuniones generadas durante la conversación y agentes de voz que necesitan comprender continuamente al usuario en lugar de esperar respuestas paso a paso.
Precio: GPT-Realtime-Whisper tiene un precio de 0,017 dólares por minuto.
Patrones arquitectónicos y nuevas voces
Los desarrolladores pueden elegir entre tres tipos de sesiones según el caso de uso: una sesión de agente de voz cuando la aplicación necesita un asistente que responda al usuario, una sesión de traducción cuando la aplicación necesita un intérprete y una sesión de transcripción cuando se necesita texto de audio sin respuestas generadas por el modelo.
En cuanto a la salida de voz, dos nuevas voces, Cedar y Marin, se unen a la lista de API exclusivamente con esta versión.
Los tres modelos (GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper) ya están disponibles a través de OpenAI Realtime API, que está disponible de forma generalizada a partir de hoy.
Conclusiones clave
GPT-Realtime-2 lleva el razonamiento de clase GPT-5 a la voz con una ventana de contexto de 128K, esfuerzo de razonamiento ajustable en cinco niveles, control de tono, llamadas de herramientas paralelas y recuperación de interrupciones. En Big Bench Audio, GPT-Realtime-2 (alto) obtiene una puntuación del 96,6 % frente al 81,4 % de GPT-Realtime-1.5; en Audio MultiChallenge, la variante xhigh obtiene una puntuación del 48,5% frente al 34,7%. GPT-Realtime-Translate maneja la traducción de voz en vivo en más de 70 idiomas de entrada a 13 idiomas de salida a $0,034/min. GPT-Realtime-Whisper transmite la transcripción en tiempo real con latencia controlable a $0,017/min. La API en tiempo real sale de la versión beta y está disponible de forma generalizada hoy junto con dos nuevas voces, Cedar y Marin.
Consulte los detalles técnicos completos aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros