La carrera por construir agentes autónomos de IA se ha topado con un enorme cuello de botella: los datos. Si bien los modelos de vanguardia como Claude Code y Codex CLI han demostrado una competencia impresionante en entornos terminales, las estrategias de capacitación y las combinaciones de datos detrás de ellos se han mantenido como secretos celosamente guardados. Esta falta de transparencia ha obligado a los investigadores y desarrolladores a entrar en un costoso ciclo de prueba y error.
NVIDIA ahora está rompiendo ese silencio al presentar un marco integral para crear agentes terminales de alto rendimiento. Al introducir Terminal-Task-Gen y el conjunto de datos Terminal-Corpus, NVIDIA esencialmente le está brindando a la comunidad de desarrolladores los planos para crear agentes que no solo ‘conversan’ sobre código, sino que realmente lo ejecutan con precisión quirúrgica.
El problema de la escasez de datos
El desafío de entrenar a un agente para la línea de comando es doble. En primer lugar, hay escasez de recursos fundamentales; específicamente, diversas indicaciones de tareas y los complejos archivos de dependencia necesarios para crear entornos realistas. En segundo lugar, capturar ‘trayectorias’ (las interacciones terminales paso a paso) es logísticamente doloroso. Las interacciones humanas son lentas de registrar y la generación sintética a través de agentes LLM es prohibitivamente costosa porque requiere una nueva creación de instancias del entorno Docker para cada turno.
Terminal-Task-Gen: una estrategia doble
La solución de NVIDIA es un proceso de generación de datos de “grueso a fino” llamado Terminal-Task-Gen. Utiliza dos estrategias distintas para escalar los datos de entrenamiento sin gastar mucho dinero.
1. Adaptación del conjunto de datos (la capa gruesa)
En lugar de empezar desde cero, el equipo aprovecha conjuntos de datos de ajuste fino supervisado (SFT) existentes de alta calidad de los dominios de matemáticas, código e ingeniería de software (SWE). Transforman estos mensajes estáticos en tareas de terminal interactivas.
Matemáticas y código: utilizando 163.000 indicaciones matemáticas y 35.000 indicaciones de código, envuelven estos desafíos en una estructura de terminal. SWE: obtienen 32.000 mensajes únicos de repositorios como SWE-bench y SWE-reBench. ¿La parte inteligente? Este proceso no requiere un LLM “en el circuito” para la adaptación inicial, lo que lo hace increíblemente eficiente para escalar el volumen.
2. Generación de tareas sintéticas (la capa fina)
Para cerrar la brecha entre el razonamiento general y los rigores específicos de la agencia de terminales, el equipo de NVIDIA utiliza Terminal-Task-Gen para crear tareas novedosas y ejecutables.
Generación basada en semillas: el LLM utiliza problemas algorítmicos o de computación científica existente como “inspiración” para sintetizar nuevas tareas. El agente se ve obligado a instalar paquetes, leer archivos de entrada y escribir resultados, reflejando el flujo de trabajo de un desarrollador del mundo real. Generación basada en habilidades: Aquí es donde la cosa se vuelve técnica. NVIDIA seleccionó una taxonomía de “habilidades terminales primitivas” en nueve dominios, incluidos seguridad, ciencia de datos y administración de sistemas. Luego, se le indica al LLM que combine de 3 a 5 de estas primitivas (como recorrido de gráfico + configuración de red + E/S de archivo) en una tarea única y compleja.
Resolver los gastos generales de infraestructura
Uno de los avances de ingeniería más importantes en esta investigación es el paso a imágenes Docker preconstruidas. Los marcos anteriores a menudo generaban un Dockerfile único para cada tarea, lo que generaba una sobrecarga masiva de tiempo de compilación y fallas frecuentes. En cambio, el equipo de NVIDIA mantiene nueve imágenes base compartidas preconfiguradas con bibliotecas esenciales (como pandas para ciencia de datos o herramientas de criptografía para seguridad). Este método de creación de ‘un solo paso’ permite una paralelización masiva y una huella de recursos significativamente menor.
Rendimiento: cuando 32B supera a 480B
Los resultados de este enfoque centrado en los datos son asombrosos. El equipo de NVIDIA utilizó este canal para entrenar la familia de modelos Nemotron-Terminal, inicializados desde Qwen3.
En el punto de referencia Terminal-Bench 2.0, que prueba agentes en flujos de trabajo de un extremo a otro, como entrenar modelos de aprendizaje automático o depurar entornos de sistemas, las mejoras fueron verticales:
Nemotron-Terminal-8B: saltó de una tasa de éxito del 2,5 % al 13,0 %. Nemotron-Terminal-32B: logró una precisión del 27,4%.
Para poner eso en perspectiva, el modelo 32B superó al Qwen3-Coder 480B (23,9%) y rivalizó con el desempeño de gigantes de código cerrado como Grok 4 (23,1%) y GPT-5-Mini (24,0%). Esto demuestra que para los agentes terminales, los datos de trayectoria diversos y de alta calidad son una palanca más poderosa que la mera escala de parámetros.
Perspectivas críticas
La investigación de NVIDIA también desmiente varios mitos comunes en la ingeniería de datos:
No filtre los errores: el equipo de investigación descubrió que mantener trayectorias “fallidas” en los datos de entrenamiento en realidad mejoró el rendimiento (12,4 % frente a 5,06 % para el filtrado de solo éxito). Exponer los modelos a estados de error y patrones de recuperación realistas los hace más sólidos. Saltarse el plan de estudios: experimentaron con el ‘aprendizaje curricular’ (entrenamiento con datos fáciles antes que con datos duros), pero descubrieron que el entrenamiento mixto simple era igual de efectivo, si no mejor. Límites de longitud del contexto: si bien las trayectorias terminales pueden ser largas, la supervisión de mayor calidad se ajusta a una ventana estándar de 32.768 tokens. Ampliar la longitud del contexto perjudica ligeramente el rendimiento, probablemente porque las trayectorias de cola larga tienden a ser más ruidosas.
Consulte la página del proyecto Paper y HF. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.