La mayoría de los sistemas de IA actuales funcionan por turnos. Usted escribe o habla, el modelo espera, procesa su entrada y luego responde. Ese es todo el ciclo de interacción. Thinking Machines Lab, un laboratorio de investigación de IA, sostiene que este modelo de interacción es un cuello de botella fundamental. El equipo de Thinking Machines Lab presentó un avance de la investigación de una nueva clase de sistema al que llaman modelos de interacción para abordarlo. La idea principal de su investigación es que la interactividad debe ser nativa del modelo en sí, no agregada como una ocurrencia tardía.
¿Qué hay de malo en la IA por turnos?
Si ha creado algo con un modelo de lenguaje o API de voz, ha solucionado las limitaciones de la interacción por turnos. El modelo no tiene conciencia de lo que sucede mientras estás escribiendo o hablando. No puede verte hacer una pausa a mitad de una frase, notar la transmisión de tu cámara o reaccionar ante algo visual en tiempo real. Mientras el modelo se genera, es igualmente ciego: la percepción se congela hasta que termina o se interrumpe.
Esto crea un canal estrecho para la colaboración entre humanos y IA que limita la cantidad de conocimiento, intención y juicio de una persona que puede llegar al modelo y la cantidad del trabajo del modelo que puede comprenderse.
Para solucionar este problema, la mayoría de los sistemas de inteligencia artificial en tiempo real utilizan un arnés: una colección de componentes separados unidos para simular la capacidad de respuesta. Un ejemplo común es la detección de actividad de voz (VAD), que predice cuándo un usuario ha terminado de hablar para que un modelo por turnos sepa cuándo comenzar a generar. Este arnés está hecho de componentes que son significativamente menos inteligentes que el modelo en sí y excluye capacidades como reacciones visuales proactivas, hablar mientras se escucha o responder a señales que nunca se expresan explícitamente en voz alta.
El argumento de Thinking Machines Lab es una versión de la "amarga lección" del aprendizaje automático: los sistemas hechos a mano eventualmente serán superados por la ampliación de las capacidades generales. Para que la interactividad crezca con la inteligencia, debe ser parte del modelo mismo. Con este enfoque, escalar un modelo lo hace más inteligente y mejor colaborador.
La arquitectura: diseño de microvueltas y flujos múltiples
El sistema tiene dos componentes que funcionan en paralelo: un modelo de interacción que mantiene un intercambio constante en tiempo real con el usuario y un modelo en segundo plano que maneja tareas de razonamiento más profundas de forma asincrónica.
El modelo de interacción está siempre activo: capta continuamente audio, vídeo y texto y produce respuestas en tiempo real. Cuando una tarea requiere un razonamiento sostenido (uso de herramientas, búsqueda web, planificación a largo plazo), se delega en el modelo en segundo plano enviando un paquete de contexto enriquecido que contiene la conversación completa, no una consulta independiente. Los resultados regresan a medida que el modelo en segundo plano los produce, y el modelo de interacción intercala esas actualizaciones en la conversación en un momento apropiado para lo que el usuario está haciendo actualmente, en lugar de como un cambio abrupto de contexto. Ambos modelos comparten su contexto en todo momento.
Piense en ello como una persona que lo mantiene involucrado en una conversación mientras un colega en el fondo busca algo y pasa notas en tiempo real.
La decisión arquitectónica clave que permite esto son los microgiros alineados en el tiempo. El modelo de interacción intercala continuamente el procesamiento de 200 ms de entrada con la generación de 200 ms de salida. En lugar de consumir un turno completo del usuario y generar una respuesta completa, tanto la entrada como la salida se tratan como transmisiones procesadas en fragmentos de 200 ms. Esto es lo que permite al modelo hablar mientras escucha, reaccionar a señales visuales sin que se le indique verbalmente, manejar el habla simultánea real y realizar llamadas a herramientas y navegar por la web mientras la conversación aún está en progreso, entrelazando los resultados a medida que llegan.
La fusión temprana sin codificador es la elección de diseño específica que hace que el procesamiento multimodal funcione a esta cadencia. En lugar de enrutar audio y video a través de codificadores grandes y preentrenados separados (como un modelo ASR estilo Whisper o un decodificador TTS independiente), la arquitectura utiliza un preprocesamiento mínimo. Las señales de audio se incorporan como dMel y se transforman mediante una capa de incrustación ligera. Los fotogramas de vídeo se dividen en parches de 40 × 40 codificados por un hMLP. La salida de audio utiliza un cabezal de flujo para decodificar. Todos los componentes se entrenan conjuntamente desde cero junto con el transformador; no hay ningún codificador o decodificador preentrenado por separado en ninguna etapa.
Por el lado de la inferencia, el diseño de fragmentos de 200 ms crea desafíos de ingeniería. Las bibliotecas de inferencia LLM existentes no están optimizadas para precargas pequeñas y frecuentes: conllevan una importante sobrecarga por turno. Thinking Machines implementó sesiones de streaming, donde el cliente envía cada fragmento de 200 ms como una solicitud separada mientras el servidor de inferencia agrega fragmentos en una secuencia persistente en la memoria de la GPU, evitando repetidas reasignaciones de memoria y cálculos de metadatos. Han actualizado una versión de esto a SGLang, el marco de inferencia de código abierto. Además, utilizan una estrategia de recopilación+gemv para los núcleos MoE en lugar del gemm agrupado estándar, siguiendo el trabajo previo de PyTorch y Cursor, para optimizar las formas sensibles a la latencia requeridas por el servicio bidireccional.
Puntos de referencia: dónde se encuentra
El modelo, denominado TML-Interaction-Small, es una mezcla de expertos (MoE) de 276B de parámetros con 12B de parámetros activos.
La tabla de referencia distingue entre modelos instantáneos (sin razonamiento extendido) y modelos de pensamiento (con razonamiento). TML-Interaction-Small es un modelo instantáneo. Entre todos los modelos Instant en la comparación, logra la puntuación más alta en Audio MultiChallenge APR con un 43,4%, por encima de GPT-realtime-2.0 (mínimo) con un 37,6%, GPT-realtime-1.5 con un 34,7% y Gemini-3.1-flash-live-preview (mínimo) con un 26,8%. Los modelos de Thinking, GPT-realtime-2.0 (xhigh) con un 48,5 % y Gemini-3.1-flash-live (high) con un 36,1 %, utilizan un razonamiento ampliado para alcanzar sus puntuaciones.
En FD-bench v1.5, que mide la calidad de la interacción en escenarios de interrupción del usuario, backchanneling, conversación con otros y habla en segundo plano, TML-Interaction-Small obtiene una calidad promedio de 77,8, en comparación con 54,3 para Gemini-3.1-flash-live (mínimo), 48,3 para GPT-realtime-1.5 y 47,8 para GPT-realtime-2.0 (xhigh).
En la latencia de turnos de FD-bench v1, el modelo responde en 0,40 segundos, en comparación con los 0,57 segundos de Gemini, los 0,59 segundos de GPT-realtime-1.5 y los 1,18 segundos de GPT-realtime-2.0 (mínimo).
En FD-bench v3, que evalúa la calidad de la respuesta y el uso de herramientas (audio + herramientas combinados), TML-Interaction-Small (con el agente en segundo plano habilitado) obtiene una puntuación de 82,8 % de calidad de respuesta/68,0 % de aprobación@1, la más alta en la tabla de comparación.
El equipo de investigación de Thinking Machines también presentó nuevos puntos de referencia internos dirigidos a capacidades que ningún modelo existente maneja:
TimeSpeak: prueba si el modelo inicia el habla en momentos especificados por el usuario con contenido correcto. TML: 64,7 macroprecisión frente a 4,3 para GPT-realtime-2.0 (mínimo). CueSpeak: prueba si el modelo responde a señales verbales en el momento correcto. TML: 81,7 frente a 2,9. RepCount-A (adaptado de un conjunto de datos de conteo de repeticiones existente): prueba el conteo visual de acciones físicas repetidas en una configuración de transmisión. TML: precisión de 35,4 de uno en uno frente a 1,3. ProactiveVideoQA (punto de referencia adaptado): prueba si el modelo responde una pregunta en el momento exacto en que la respuesta está disponible visualmente en un video transmitido. TML: 33,5 PAUC@ω=0,5 frente a 25,0 (el valor inicial sin respuesta). Charadas (adaptado para la localización de acciones temporales): se le pide al modelo que diga "iniciar" y "detener" cuando una acción comienza y termina en un video transmitido. TML: 32,4 mIoU frente a 0 para GPT-realtime-2.0 (mínimo): un cero limpio.
Hasta el momento, ningún modelo existente puede realizar de manera significativa ninguna de estas tareas.
Explicador visual de Marktechpost
Conclusiones clave
El modelo de interacción de Thinking Machines Lab maneja audio, video y texto en tiempo real de forma nativa: sin arnés VAD, sin límites de giro, sin componentes cosidos. La arquitectura se divide en dos modelos: un modelo de interacción que permanece activo con el usuario y un modelo en segundo plano que maneja el razonamiento y el uso de herramientas de forma asincrónica, compartiendo el contexto completo de la conversación en todo momento. Los microgiros de 200 ms reemplazan el bucle de solicitud-respuesta estándar, lo que permite hablar simultáneamente, proactividad visual y llamadas de herramientas en vivo sin esperar a que finalice el turno del usuario. En FD-bench v1.5 (calidad de interacción), TML-Interaction-Small obtiene una puntuación de 77,8, frente a 54,3 para Gemini y 47,8 para GPT-realtime-2.0 (xhigh), al tiempo que lidera todos los modelos instantáneos en los puntos de referencia de inteligencia de Audio MultiChallenge. Las API en tiempo real existentes obtienen una puntuación cercana a cero en los puntos de referencia de proactividad visual y conciencia del tiempo (TimeSpeak, CueSpeak, Charades, RepCount-A): TML-Interaction-Small es el único modelo que puede realizar estas tareas de manera significativa en la actualidad.
Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros