Andrej Karpathy lanzó la investigación automática, una herramienta Python minimalista diseñada para permitir a los agentes de IA realizar experimentos de aprendizaje automático de forma autónoma. El proyecto es una versión simplificada del núcleo de capacitación LLM de nanochat, condensado en un repositorio de un solo archivo de aproximadamente ~630 líneas de código. Está optimizado para su ejecución en una única GPU NVIDIA.
El bucle de iteración autónoma
El marco establece una división específica del trabajo entre el investigador humano y el agente de IA. El sistema opera en un ciclo de retroalimentación continuo donde el progreso se rastrea mediante confirmaciones de git en una rama de funciones.
El agente lee las instrucciones proporcionadas por humanos, modifica el código de entrenamiento (ajustando la arquitectura de la red neuronal, optimizadores o hiperparámetros) y ejecuta una ejecución de entrenamiento que dura exactamente cinco minutos.
Métricas de evaluación y validación
Para garantizar que el agente solo retenga los cambios beneficiosos, el sistema utiliza bits por byte (BPB) como métrica de validación principal. BPB mide la eficiencia de compresión del modelo en un conjunto de datos de validación; una puntuación más baja indica un modelo más preciso.
Protocolo de validación: el agente solo confirma cambios de código en la rama git si la puntuación final de BPB es inferior a la mejor anterior. Rendimiento observado: en las ejecuciones iniciales, Karpathy demostró que el agente reducía con éxito la pérdida de validación de 1,0 a 0,97 BPB mediante la iteración autónoma del código. Granularidad: cada ejecución de entrenamiento completa de 5 minutos se representa como un punto de datos, lo que permite a los investigadores comparar la efectividad de diferentes indicaciones o configuraciones de agentes a lo largo del tiempo.
Estudio de caso: Implementación por Tobi Lutke de Shopify
Tras el lanzamiento, el director ejecutivo de Shopify, Tobi Lutke, adaptó el marco de investigación automática para un proyecto interno. Al permitir que el agente itere en una arquitectura de modelo más pequeña, Lutke informó una mejora del 19 % en las puntuaciones de validación. En particular, el modelo más pequeño optimizado por el agente finalmente superó a un modelo más grande que se había configurado mediante métodos manuales estándar.
Karpathy señaló que los ajustes de código específicos descubiertos por el agente se integraron posteriormente en su marco más amplio de nanochat, lo que demuestra que la herramienta puede descubrir optimizaciones aplicables a sistemas de producción a mayor escala.
Importancia técnica para los desarrolladores
Para los desarrolladores, la investigación automática representa un cambio hacia flujos de trabajo “agentes” en el desarrollo de modelos. En lugar de ajustar manualmente los hiperparámetros, la tarea de ingeniería cambia para solicitar al agente que navegue por el espacio de búsqueda de manera más efectiva. La restricción de ~630 líneas garantiza que todo el código base se ajuste a la ventana de contexto de los LLM modernos, minimizando los errores en la generación de código y permitiendo al agente mantener una comprensión “holística” del guión de entrenamiento.
Conclusiones clave
Bucle de investigación autónomo: el marco permite a los agentes de IA iterar de forma autónoma en experimentos de aprendizaje automático leyendo un archivo de instrucciones Markdown (.md) proporcionado por humanos y modificando un script de entrenamiento de Python (.py) sin intervención manual. Núcleo de ~630 líneas: al reducir el núcleo de capacitación de LLM de nanochat a un repositorio de un solo archivo de ~630 líneas, la base de código es lo suficientemente pequeña como para caber completamente dentro de la ventana contextual de un LLM, lo que reduce los errores de generación de código. Métricas basadas en la eficiencia: el agente ejecuta sprints de entrenamiento fijos de 5 minutos en una única GPU NVIDIA y solo confirma cambios de código en una rama de funciones de git si dan como resultado una puntuación de validación de bits por byte (BPB) más baja. Mejoras de rendimiento comprobadas: en una prueba del mundo real (como se menciona en un tweet), el director ejecutivo de Shopify, Tobi Lutke, utilizó la herramienta para lograr una mejora del 19 % en las puntuaciones del modelo, lo que dio como resultado un modelo más pequeño, optimizado por el agente, que superó a uno más grande configurado manualmente. Cambio en el enfoque de ingeniería: el proyecto traslada el papel del desarrollador del ajuste manual de hiperparámetros a la ingeniería de agentes, donde el objetivo es optimizar las indicaciones que dirigen a la IA para encontrar las arquitecturas neuronales y las configuraciones de entrenamiento más eficientes.
Consulte el repositorio aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.