Modelos de lenguaje recursivo (RLM): del Blueprint del MIT al RLMEnv de Prime Intellect para agentes LLM de largo plazo

Los modelos de lenguaje recursivos tienen como objetivo romper el equilibrio habitual entre longitud del contexto, precisión y costo en modelos de lenguaje grandes. En lugar de obligar a un modelo a leer un mensaje gigante de una sola vez, los RLM tratan el mensaje como un entorno externo y permiten que el modelo decida cómo inspeccionarlo con código, luego se llama a sí mismo de forma recursiva en piezas más pequeñas.

https://arxiv.org/pdf/2512.24601

Los conceptos básicos

La entrada completa se carga en un REPL de Python como una variable de cadena única. El modelo raíz, por ejemplo GPT-5, nunca ve esa cadena directamente en su contexto. En su lugar, recibe un mensaje del sistema que explica cómo leer partes de la variable, escribir funciones auxiliares, generar subllamadas LLM y combinar resultados. El modelo devuelve una respuesta de texto final, por lo que la interfaz externa permanece idéntica a un punto final de finalización de chat estándar.

El diseño RLM utiliza el REPL como plano de control para un contexto largo. El entorno, generalmente escrito en Python, expone herramientas como corte de cadenas, búsqueda de expresiones regulares y funciones auxiliares como llm_query que llaman a una instancia de modelo más pequeña, por ejemplo GPT-5-mini. El modelo raíz escribe código que llama a estos ayudantes para escanear, particionar y resumir la variable de contexto externo. El código puede almacenar resultados intermedios en variables y construir la respuesta final paso a paso. Esta estructura hace que el tamaño del mensaje sea independiente de la ventana de contexto del modelo y convierte el manejo de contexto prolongado en un problema de síntesis del programa.

https://arxiv.org/pdf/2512.24601

¿Dónde se encuentra en Evaluación?

El artículo de investigación evalúa esta idea en cuatro puntos de referencia de contexto largo con diferentes estructuras computacionales. S-NIAH es una aguja de complejidad constante en una tarea de pajar. BrowseComp-Plus es un punto de referencia de respuesta a preguntas de estilo web de múltiples saltos en hasta 1000 documentos. OOLONG es una tarea de razonamiento de contexto largo de complejidad lineal en la que el modelo debe transformar muchas entradas y luego agregarlas. OOLONG Pairs aumenta aún más la dificultad con agregación cuadrática por pares sobre la entrada. Estas tareas enfatizan tanto la extensión del contexto como la profundidad del razonamiento, no solo la recuperación.

En estos puntos de referencia, los RLM ofrecen grandes ganancias en precisión con respecto a las llamadas directas de LLM y los agentes de contexto largo comunes. Para GPT-5 en CodeQA, una configuración de respuesta a preguntas de documentos largos, el modelo base alcanza una precisión de 24,00, un agente de resumen alcanza 41,33, mientras que RLM alcanza 62,00 y el RLM sin recursividad alcanza 66,00. Para Qwen3-Coder-480B-A35B, el modelo base obtiene una puntuación de 20,00, un agente de recuperación CodeAct de 52,00 y el RLM de 56,00 con una variante solo REPL de 44,66.

Las ganancias son mayores en la configuración más difícil, OOLONG Pairs. Para GPT-5, el modelo directo es casi inutilizable con F1 igual a 0,04. Los agentes de resumen y CodeAct se encuentran cerca de 0,01 y 24,67. El RLM completo alcanza 58,00 F1 y la variante REPL no recursiva aún alcanza 43,93. Para Qwen3-Coder, el modelo base se mantiene por debajo de 0.10 F1, mientras que el RLM completo llega a 23.11 y el REPL solo a la versión 17.34. Estos números muestran que tanto REPL como las subllamadas recursivas son fundamentales en tareas cuadráticas densas.

https://arxiv.org/pdf/2512.24601

BrowseComp-Plus destaca la extensión de contexto efectiva. El corpus oscila entre aproximadamente 6 millones y 11 millones de tokens, lo que es 2 órdenes de magnitud más allá de la ventana de contexto de 272k tokens de GPT-5. RLM con GPT 5 mantiene un rendimiento sólido incluso cuando se le asignan 1000 documentos en la variable de entorno, mientras que las líneas base estándar de GPT-5 se degradan a medida que aumenta el número de documentos. En este punto de referencia, RLM GPT 5 logra una precisión de alrededor de 91,33 con un costo promedio de 0,99 USD por consulta, mientras que un modelo hipotético que lea el contexto completo directamente costaría entre $1,50 y $2,75 al precio actual.

El artículo de investigación también analiza las trayectorias de las carreras RLM. Surgen varios patrones de comportamiento. El modelo a menudo comienza con un paso de vistazo en el que inspecciona los primeros miles de caracteres del contexto. Luego utiliza el filtrado de estilo grep con expresiones regulares o búsqueda de palabras clave para limitar las líneas relevantes. Para consultas más complejas, divide el contexto en fragmentos y llama a LM recursivos en cada fragmento para realizar el etiquetado o la extracción, seguido de la agregación programática. En tareas de salida largas, el RLM almacena salidas parciales en variables y las une, lo que pasa por alto los límites de longitud de salida del modelo base.

La nueva versión de Prime Intellect

El equipo de Prime Intellect ha convertido este concepto en un entorno concreto, RLMEnv, integrado en su pila de verificadores y Environments Hub. En su diseño, el RLM principal tiene solo un REPL de Python, mientras que los subLLM reciben herramientas pesadas como búsqueda web o acceso a archivos. El REPL expone una función llm_batch para que el modelo raíz pueda desplegar muchas subconsultas en paralelo y una variable de respuesta donde la solución final debe escribirse y marcarse como lista. Esto aísla los resultados de las herramientas con muchos tokens del contexto principal y permite que el RLM delegue operaciones costosas a submodelos.

Prime Intellect evalúa esta implementación en cuatro entornos. DeepDive prueba la investigación web con herramientas abiertas y de búsqueda y páginas muy detalladas. Math Python expone un REPL de Python para problemas matemáticos difíciles de estilo competitivo. Oolong reutiliza el punto de referencia de contexto largo dentro de RLMEnv. La copia literal se centra en la reproducción exacta de cadenas complejas en tipos de contenido como JSON, CSV y códigos mixtos. En estos entornos, GPT-5-mini y el modelo INTELLECT-3-MoE se benefician del andamio RLM en tasa de éxito y robustez en contextos muy largos, especialmente cuando la salida de la herramienta de otro modo inundaría el contexto del modelo.

El equipo de autores del artículo de investigación y el equipo de Prime Intellect enfatizan que las implementaciones actuales no están completamente optimizadas. Las llamadas RLM son sincrónicas, la profundidad de la recursividad es limitada y las distribuciones de costos tienen colas pesadas debido a trayectorias muy largas. La verdadera oportunidad es combinar el andamiaje RLM con el aprendizaje de refuerzo dedicado para que los modelos aprendan mejores políticas de fragmentación, recursividad y uso de herramientas a lo largo del tiempo. Si eso sucede, los RLM proporcionan un marco donde las mejoras en los modelos base y en el diseño de sistemas se convierten directamente en agentes de largo plazo más capaces que pueden consumir más de 10 millones de entornos simbólicos sin deterioro del contexto.

Conclusiones clave

Aquí hay cinco conclusiones técnicas y concisas que puede incluir en el artículo.

Los RLM replantean el contexto largo como una variable de entorno: los modelos de lenguaje recursivo tratan el mensaje completo como una cadena externa en un REPL estilo Python, que el LLM inspecciona y transforma a través del código, en lugar de ingerir todos los tokens directamente en el contexto del Transformer. La recursión del tiempo de inferencia extiende el contexto a más de 10 millones de tokens: los RLM permiten que un modelo raíz llame recursivamente a subLLM en fragmentos seleccionados del contexto, lo que permite el procesamiento efectivo de solicitudes hasta aproximadamente 2 órdenes de magnitud más largas que la ventana de contexto base, alcanzando más de 10 millones de tokens en cargas de trabajo de estilo BrowseComp-Plus. Los RLM superan a los andamios de contexto largo comunes en puntos de referencia estrictos: en los pares S-NIAH, BrowseComp-Plus, OOLONG y OOLONG, las variantes de RLM de GPT-5 y Qwen3-Coder mejoran la precisión y F1 sobre las llamadas directas de modelos, los agentes de recuperación como CodeAct y los agentes de resumen, al tiempo que mantienen el costo por consulta comparable o inferior. Las variantes que solo REPL ya ayudan, la recursividad es fundamental para las tareas cuadráticas: una ablación que solo expone el REPL sin subllamadas recursivas aún aumenta el rendimiento en algunas tareas, lo que muestra el valor de descargar contexto en el entorno, pero se requieren RLM completos para lograr grandes ganancias en configuraciones densas en información como los pares OOLONG. Prime Intellect pone en funcionamiento RLM a través de RLMEnv e INTELLECT 3: el equipo de Prime Intellect implementa el paradigma RLM como RLMEnv, donde el LM raíz controla un REPL de Python en espacio aislado, llama a herramientas a través de sub LM y escribe el resultado final en una variable de respuesta, e informa ganancias consistentes en entornos DeepDive, Python matemático, Oolong y copia textual con modelos como INTELLECT-3.

Consulte el documento y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como empresario e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.