El laboratorio Thinking Machines de Mira Murati presenta modelos de interacción: una arquitectura multimodal nativa para la colaboración entre humanos e IA en tiempo real

La mayoría de los sistemas de IA actuales funcionan por turnos. Usted escribe o habla, el modelo espera, procesa su entrada y luego responde. Ese es todo el ciclo de interacción. Thinking Machines Lab, un laboratorio de investigación de IA, sostiene que este modelo de interacción es un cuello de botella fundamental. El equipo de Thinking Machines Lab presentó un avance de la investigación de una nueva clase de sistema al que llaman modelos de interacción para abordarlo. La idea principal de su investigación es que la interactividad debe ser nativa del modelo en sí, no agregada como una ocurrencia tardía.

¿Qué hay de malo en la IA por turnos?

Si ha creado algo con un modelo de lenguaje o API de voz, ha solucionado las limitaciones de la interacción por turnos. El modelo no tiene conciencia de lo que sucede mientras estás escribiendo o hablando. No puede verte hacer una pausa a mitad de una frase, notar la transmisión de tu cámara o reaccionar ante algo visual en tiempo real. Mientras el modelo se genera, es igualmente ciego: la percepción se congela hasta que termina o se interrumpe.

Esto crea un canal estrecho para la colaboración entre humanos y IA que limita la cantidad de conocimiento, intención y juicio de una persona que puede llegar al modelo y la cantidad del trabajo del modelo que puede comprenderse.

Para solucionar este problema, la mayoría de los sistemas de inteligencia artificial en tiempo real utilizan un arnés: una colección de componentes separados unidos para simular la capacidad de respuesta. Un ejemplo común es la detección de actividad de voz (VAD), que predice cuándo un usuario ha terminado de hablar para que un modelo por turnos sepa cuándo comenzar a generar. Este arnés está hecho de componentes que son significativamente menos inteligentes que el modelo en sí y excluye capacidades como reacciones visuales proactivas, hablar mientras se escucha o responder a señales que nunca se expresan explícitamente en voz alta.

El argumento de Thinking Machines Lab es una versión de la "amarga lección" del aprendizaje automático: los sistemas hechos a mano eventualmente serán superados por la ampliación de las capacidades generales. Para que la interactividad crezca con la inteligencia, debe ser parte del modelo mismo. Con este enfoque, escalar un modelo lo hace más inteligente y mejor colaborador.

https://thinkingmachines.ai/blog/interaction-models/

La arquitectura: diseño de microvueltas y flujos múltiples

El sistema tiene dos componentes que funcionan en paralelo: un modelo de interacción que mantiene un intercambio constante en tiempo real con el usuario y un modelo en segundo plano que maneja tareas de razonamiento más profundas de forma asincrónica.

El modelo de interacción está siempre activo: capta continuamente audio, vídeo y texto y produce respuestas en tiempo real. Cuando una tarea requiere un razonamiento sostenido (uso de herramientas, búsqueda web, planificación a largo plazo), se delega en el modelo en segundo plano enviando un paquete de contexto enriquecido que contiene la conversación completa, no una consulta independiente. Los resultados regresan a medida que el modelo en segundo plano los produce, y el modelo de interacción intercala esas actualizaciones en la conversación en un momento apropiado para lo que el usuario está haciendo actualmente, en lugar de como un cambio abrupto de contexto. Ambos modelos comparten su contexto en todo momento.

Piense en ello como una persona que lo mantiene involucrado en una conversación mientras un colega en el fondo busca algo y pasa notas en tiempo real.

La decisión arquitectónica clave que permite esto son los microgiros alineados en el tiempo. El modelo de interacción intercala continuamente el procesamiento de 200 ms de entrada con la generación de 200 ms de salida. En lugar de consumir un turno completo del usuario y generar una respuesta completa, tanto la entrada como la salida se tratan como transmisiones procesadas en fragmentos de 200 ms. Esto es lo que permite al modelo hablar mientras escucha, reaccionar a señales visuales sin que se le indique verbalmente, manejar el habla simultánea real y realizar llamadas a herramientas y navegar por la web mientras la conversación aún está en progreso, entrelazando los resultados a medida que llegan.

La fusión temprana sin codificador es la elección de diseño específica que hace que el procesamiento multimodal funcione a esta cadencia. En lugar de enrutar audio y video a través de codificadores grandes y preentrenados separados (como un modelo ASR estilo Whisper o un decodificador TTS independiente), la arquitectura utiliza un preprocesamiento mínimo. Las señales de audio se incorporan como dMel y se transforman mediante una capa de incrustación ligera. Los fotogramas de vídeo se dividen en parches de 40 × 40 codificados por un hMLP. La salida de audio utiliza un cabezal de flujo para decodificar. Todos los componentes se entrenan conjuntamente desde cero junto con el transformador; no hay ningún codificador o decodificador preentrenado por separado en ninguna etapa.

Por el lado de la inferencia, el diseño de fragmentos de 200 ms crea desafíos de ingeniería. Las bibliotecas de inferencia LLM existentes no están optimizadas para precargas pequeñas y frecuentes: conllevan una importante sobrecarga por turno. Thinking Machines implementó sesiones de streaming, donde el cliente envía cada fragmento de 200 ms como una solicitud separada mientras el servidor de inferencia agrega fragmentos en una secuencia persistente en la memoria de la GPU, evitando repetidas reasignaciones de memoria y cálculos de metadatos. Han actualizado una versión de esto a SGLang, el marco de inferencia de código abierto. Además, utilizan una estrategia de recopilación+gemv para los núcleos MoE en lugar del gemm agrupado estándar, siguiendo el trabajo previo de PyTorch y Cursor, para optimizar las formas sensibles a la latencia requeridas por el servicio bidireccional.

https://thinkingmachines.ai/blog/interaction-models/

Puntos de referencia: dónde se encuentra

El modelo, denominado TML-Interaction-Small, es una mezcla de expertos (MoE) de 276B de parámetros con 12B de parámetros activos.

La tabla de referencia distingue entre modelos instantáneos (sin razonamiento extendido) y modelos de pensamiento (con razonamiento). TML-Interaction-Small es un modelo instantáneo. Entre todos los modelos Instant en la comparación, logra la puntuación más alta en Audio MultiChallenge APR con un 43,4%, por encima de GPT-realtime-2.0 (mínimo) con un 37,6%, GPT-realtime-1.5 con un 34,7% y Gemini-3.1-flash-live-preview (mínimo) con un 26,8%. Los modelos de Thinking, GPT-realtime-2.0 (xhigh) con un 48,5 % y Gemini-3.1-flash-live (high) con un 36,1 %, utilizan un razonamiento ampliado para alcanzar sus puntuaciones.

En FD-bench v1.5, que mide la calidad de la interacción en escenarios de interrupción del usuario, backchanneling, conversación con otros y habla en segundo plano, TML-Interaction-Small obtiene una calidad promedio de 77,8, en comparación con 54,3 para Gemini-3.1-flash-live (mínimo), 48,3 para GPT-realtime-1.5 y 47,8 para GPT-realtime-2.0 (xhigh).

En la latencia de turnos de FD-bench v1, el modelo responde en 0,40 segundos, en comparación con los 0,57 segundos de Gemini, los 0,59 segundos de GPT-realtime-1.5 y los 1,18 segundos de GPT-realtime-2.0 (mínimo).

En FD-bench v3, que evalúa la calidad de la respuesta y el uso de herramientas (audio + herramientas combinados), TML-Interaction-Small (con el agente en segundo plano habilitado) obtiene una puntuación de 82,8 % de calidad de respuesta/68,0 % de aprobación@1, la más alta en la tabla de comparación.

https://thinkingmachines.ai/blog/interaction-models/

El equipo de investigación de Thinking Machines también presentó nuevos puntos de referencia internos dirigidos a capacidades que ningún modelo existente maneja:

TimeSpeak: prueba si el modelo inicia el habla en momentos especificados por el usuario con contenido correcto. TML: 64,7 macroprecisión frente a 4,3 para GPT-realtime-2.0 (mínimo). CueSpeak: prueba si el modelo responde a señales verbales en el momento correcto. TML: 81,7 frente a 2,9. RepCount-A (adaptado de un conjunto de datos de conteo de repeticiones existente): prueba el conteo visual de acciones físicas repetidas en una configuración de transmisión. TML: precisión de 35,4 de uno en uno frente a 1,3. ProactiveVideoQA (punto de referencia adaptado): prueba si el modelo responde una pregunta en el momento exacto en que la respuesta está disponible visualmente en un video transmitido. TML: 33,5 PAUC@ω=0,5 frente a 25,0 (el valor inicial sin respuesta). Charadas (adaptado para la localización de acciones temporales): se le pide al modelo que diga "iniciar" y "detener" cuando una acción comienza y termina en un video transmitido. TML: 32,4 mIoU frente a 0 para GPT-realtime-2.0 (mínimo): un cero limpio.

Hasta el momento, ningún modelo existente puede realizar de manera significativa ninguna de estas tareas.

Explicador visual de Marktechpost

Modelos de interacción: Guía de introducción 01 / 07
01 — Descripción general

¿Qué son los modelos de interacción?

Vista previa de la investigación: mayo de 2026

Thinking Machines Lab presentó modelos de interacción: una nueva clase de sistema de inteligencia artificial donde la interactividad en tiempo real es nativa del modelo en sí, no está integrada a través de andamios externos.

A diferencia de las API LLM estándar que funcionan en un bucle de solicitud-respuesta, los modelos de interacción perciben y responden continuamente a través de audio, video y texto al mismo tiempo, de la misma manera que funciona una conversación humana en vivo.

API estándar de LLM

Por turnos. El modelo espera su entrada completa y luego genera una respuesta completa. La percepción se congela durante la generación.

Modelos de interacción

Continuo. El modelo percibe y responde en paralelo en fragmentos de 200 ms, a través de audio, video y texto simultáneamente.

02 — Arquitectura

Cómo funciona el sistema de dos modelos

El sistema se basa en dos componentes que se ejecutan en paralelo y comparten el mismo contexto en todo momento.

Modelo de interacción

Vive siempre. Recibe audio, vídeo y texto en fragmentos continuos de 200 ms. Maneja el flujo de conversación, las interrupciones, los canales secundarios y las respuestas inmediatas en tiempo real.

Modelo de fondo

Se ejecuta de forma asincrónica. Maneja el razonamiento profundo, las llamadas a herramientas, la búsqueda web y el trabajo a más largo plazo. Recibe la conversación completa, no solo una consulta independiente, y transmite los resultados a medida que llegan.

El modelo de interacción permanece presente durante las tareas en segundo plano: recibe nuevos aportes, responde a seguimientos e integra los resultados en la conversación en el momento adecuado, no como un cambio abrupto de contexto.

03 — Capacidades

Lo que realmente puedes hacer

Debido a que la interactividad es nativa del modelo, estos son comportamientos integrados, no funciones de aprovechamiento:

Habla simultánea: hable y escuche al mismo tiempo (por ejemplo, traducción en vivo del español al inglés mientras habla) Interjecciones verbales: el modelo salta a mitad de la oración según el contexto, no solo cuando deja de hablar Proactividad visual: el modelo reacciona a lo que ve en la cámara sin que usted diga nada (por ejemplo, contar flexiones, marcar un error de código que ve) Conciencia del tiempo: el modelo rastrea el tiempo transcurrido y puede iniciar el habla en momentos especificados por el usuario Uso simultáneo de herramientas: busca en web, llama a herramientas y genera interfaz de usuario mientras la conversación aún está en curso. Gestión fluida del diálogo: rastrea pausas, autocorrecciones y señales de rendimiento sin un componente VAD separado.

04 — Diseño Técnico

La arquitectura de microgiro

Para los ingenieros que tengan curiosidad sobre cómo funciona esto internamente, tres opciones de diseño hacen posible el procesamiento multimodal en tiempo real:

Microgiros de 200 ms —————————————— Flujo de entrada: [fragmento 0][fragmento 1][fragmento 2][fragmento 3]… Flujo de salida: [fragmento 0][fragmento 1][fragmento 2][fragmento 3]… Intercalado: in_0 out_0 in_1 out_1 in_2 out_2… Entrada de audio: dMel + capa de incrustación ligera Entrada de vídeo: Parches de 40 × 40 a través de hMLP Salida de audio: decodificador de cabezal de flujo Todos los componentes entrenados desde cero con transformador

En lugar de enrutar audio y video a través de codificadores grandes previamente entrenados (como Whisper), las entradas se procesan mediante incrustaciones mínimas y se entrenan conjuntamente desde cero, lo que se denomina fusión temprana sin codificador .

En el lado de la inferencia, las sesiones de transmisión agregan cada fragmento de 200 ms a una secuencia persistente en la memoria de la GPU, evitando reasignaciones de memoria repetidas y cálculos de metadatos por solicitud. Se ha actualizado una versión de esto a SGLang.

05 — Puntos de referencia

Cómo funciona TML-Interaction-Small

El modelo es un MoE de 276B de parámetros con 12B de parámetros activos. Resultados clave frente a otros modelos instantáneos (sin pensamiento) en tiempo real:

77.8 FD-banco v1.5
Calidad de interacción

0,40 s FD-banco v1
Latencia de giro

43.4 Multidesafío de audio
APR (mejor instante)

82,8% FD-bench v3
Calidad de respuesta

En puntos de referencia proactivos/conscientes del tiempo donde ningún modelo existente tiene un rendimiento significativo: TimeSpeak 64.7, CueSpeak 81.7, RepCount-A 35.4, Charades mIoU 32.4, frente a casi cero para todos los demás modelos probados, incluido GPT-realtime-2.0.

06 — Obteniendo acceso

Cómo unirse a la vista previa

A partir de mayo de 2026, Thinking Machines Lab abrirá una vista previa de investigación limitada para recopilar comentarios. Está previsto un lanzamiento más amplio más adelante en 2026.

Solicite acceso temprano: comuníquese con el equipo a través de thinkmachines.ai (enlace de correo electrónico en la publicación del blog) Programa de becas de investigación: hay una beca de investigación disponible para trabajar en puntos de referencia de modelos de interacción, marcos de evaluación e investigación de colaboración entre humanos y IA Siga Thinking Machines Lab: actualizaciones y anuncios de lanzamiento más amplios en thinkmachines.ai Contribuya con puntos de referencia: el laboratorio invita explícitamente a la comunidad a desarrollar nuevos marcos para medir la calidad de la interactividad, un área que consideran desatendida

Nota

Esta es una vista previa de la investigación, no una API de producción. El acceso es cerrado y limitado durante esta fase.

07 — Limitaciones

Lo que debe saber antes de construir

Thinking Machines Lab es transparente sobre los puntos débiles del sistema actual:

Sesiones largas

El audio y el vídeo continuos acumulan contexto rápidamente. Las sesiones muy largas todavía requieren una gestión cuidadosa del contexto: un área de trabajo activa.

Dependencia de la red

La transmisión en secuencias de 200 ms requiere una conectividad confiable. Las malas conexiones degradan significativamente la experiencia.

Tamaño del modelo

Existen modelos preentrenados más grandes, pero actualmente son demasiado lentos para funcionar en tiempo real. Se planean variantes más grandes para más adelante en 2026.

Seguridad y alineación

La interacción en tiempo real abre nuevas preguntas de investigación sobre alineación. La recopilación de comentarios está activa. Tasa de rechazo de Harmbench: 99,0%.

Fuente: Thinking Machines Lab, “Modelos de interacción: un enfoque escalable para la colaboración entre humanos y IA”, mayo de 2026 – thinkmachines.ai/blog/interaction-models

Conclusiones clave

El modelo de interacción de Thinking Machines Lab maneja audio, video y texto en tiempo real de forma nativa: sin arnés VAD, sin límites de giro, sin componentes cosidos. La arquitectura se divide en dos modelos: un modelo de interacción que permanece activo con el usuario y un modelo en segundo plano que maneja el razonamiento y el uso de herramientas de forma asincrónica, compartiendo el contexto completo de la conversación en todo momento. Los microgiros de 200 ms reemplazan el bucle de solicitud-respuesta estándar, lo que permite hablar simultáneamente, proactividad visual y llamadas de herramientas en vivo sin esperar a que finalice el turno del usuario. En FD-bench v1.5 (calidad de interacción), TML-Interaction-Small obtiene una puntuación de 77,8, frente a 54,3 para Gemini y 47,8 para GPT-realtime-2.0 (xhigh), al tiempo que lidera todos los modelos instantáneos en los puntos de referencia de inteligencia de Audio MultiChallenge. Las API en tiempo real existentes obtienen una puntuación cercana a cero en los puntos de referencia de proactividad visual y conciencia del tiempo (TimeSpeak, CueSpeak, Charades, RepCount-A): TML-Interaction-Small es el único modelo que puede realizar estas tareas de manera significativa en la actualidad.

[insertar]https://www.youtube.com/watch?v=A12AVongNN4[/embed]

Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros