Generalist AI ha lanzado GEN-1.5, un modelo básico de robot que aprende una nueva tarea física a partir de una sola demostración. Coloque de 3 a 12 segundos de datos sensoriomotores en su ventana contextual de 30 segundos y el robot realizará la tarea. Sin actualizaciones de gradiente, sin ajustes, sin programación de tareas específicas. En 10 tareas de manipulación diversas, esta activación única en contexto promedió un 59 % de éxito (±10 % de desarrollo estándar) directamente desde el modelo previamente entrenado. Diez pasos de gradiente en cinco minutos de datos por tarea elevaron esa cifra al 83% (±9%). Generalist llama al mecanismo estímulo físico y dice que nunca fue entrenado para ello: sin cambios arquitectónicos, sin bucle de metaaprendizaje, sin objetivos auxiliares. Surgió de más de ocho meses de entrenamiento previo continuo sobre datos de interacción física. Las tareas son sencillas y de corto plazo, y la empresa lo dice claramente. Pero este es el primer modelo que su equipo conoce en el que ha surgido a escala el aprendizaje de habilidades físicas de una sola vez.
¿Es desplegable?
Todavía no: este es un comunicado de investigación. No hay pesos públicos, ni API, ni página de precios ni producto de autoservicio. La IA generalista ejecuta GEN-1.5 en su propia flota y motor de datos. Quien lo desee hoy pasa por una asociación directa.
¿Qué es GEN-1.5?
GEN-1.5 es un modelo multimodal de gran tamaño que recibe entradas de video, sensores, lenguaje y propioceptivos, tiene 30 segundos de memoria y emite trayectorias de acción de 100 Hz. Ha estado preentrenándose continuamente durante más de ocho meses sobre datos de interacción física capturados en hogares, almacenes y fábricas.
El mecanismo principal es el estímulo físico. Un ejemplo sensoriomotor (flujos de sensores más la trayectoria de acción) se inserta en la ventana contextual de 30 segundos a través de una interfaz de arrastrar y soltar. El resto de la ventana contiene observaciones continuas. Luego, el modelo realiza la tarea inmediatamente, con pasos de gradiente cero y sin ajustes.
Lo más importante es que nada de esto fue diseñado. Los generalistas afirman que no hubo cambios arquitectónicos para promover el aprendizaje en contexto, ni bucles de metaaprendizaje ni objetivos auxiliares que fomenten la improvisación. La capacidad surgió de la escala de preentrenamiento, de la misma manera que surgieron las indicaciones de un solo disparo en GPT-3.
los numeros
En 10 tareas diversas, las indicaciones únicas en contexto promediaron un 59 % de éxito (±10 % de desviación estándar) del modelo previamente entrenado, sin ningún tipo de capacitación. Diez pasos de gradiente en cinco minutos de datos por tarea (aproximadamente 50 demostraciones) elevaron esa cifra al 83% (±9%). En el caso extremo, un paso de gradiente en un minuto de datos alcanzó el 66,5% en una tarea retenida, sin barrido de hiperparámetros específico de adaptación.
La historia de la computación es la parte interesante. La adaptación de las políticas de robots normalmente ha requerido decenas de miles de pasos de gradiente. Diez pasos aquí mueven los pesos del modelo en las tareas pendientes en menos del 0,15%, lo que sugiere que el ajuste es reconfigurar el conocimiento que el modelo ya tiene en lugar de construir nuevas representaciones. Generalist lo encuadra como un entrenamiento en tiempo de prueba en un régimen de datos extremadamente bajos.
Tres resultados de transferencias que vale la pena conocer
Generalización compositiva: dos indicaciones grabadas de forma independiente y colocadas en contexto se encadenan en un comportamiento continuo. El modelo produce los movimientos puente (reposicionamiento, recaptación, recuperación de errores) que no aparecen en ninguna de las demostraciones. Sim-to-real de disparo cero: una demostración grabada íntegramente en simulación funciona como un aviso para el robot real, a pesar de que el entrenamiento previo no contiene datos de simulación, ni video renderizado ni dinámica simulada. Para algunas tareas, ya no es necesario recopilar demostraciones físicamente. Imitación de humano a robot: En algunos casos una persona hace una demostración con sus propias manos, a la vista de las cámaras del robot, y el modelo lo reproduce con las manos del robot.
La generalización también aparece después de un ligero ajuste. Entrenado durante cinco minutos cepillando un bloque en un recipiente, el modelo usó un plátano como cepillo improvisado y en su lugar usó un recogedor para levantar y tirar el bloque: una secuencia de contacto completamente diferente. También quitó una hoja de papel que cubría el cuenco y trabajó de forma ambidiestra cuando las demostraciones utilizaban una mano.