Los conjuntos de datos de manipulación de robots han crecido mucho más lentamente que los modelos entrenados en ellos, principalmente porque la recopilación permanece cerrada y centralizada. Los operadores expertos recopilan demostraciones de hardware de laboratorio, las procesan fuera de línea y envían un punto de referencia fijo que nunca vuelve a crecer. Un equipo de investigación de Axis Robotics, UC Berkeley, Georgia Tech, NTU… propone una forma diferente para el problema. Su sistema, AXIS, traslada la recopilación de demostración al navegador, envía todo lo demás a las GPU de backend y trata el conjunto de datos como algo que sigue expandiéndose en lugar de algo que se envía una vez.
¿Es desplegable? Parcialmente. El código de capacitación es público como una capa de parche sobre OpenPI y la plataforma de teleoperación está disponible en cualquier navegador. El conjunto de datos de Hugging Face tiene un tamaño limitado de 2,36 TB y está restringido al uso académico no comercial. No se liberan puntos de control de políticas.
El navegador y el backend se dividen
La decisión central del sistema es la asimetría. Los colaboradores teleoperan un Franka Research 3 con una pinza de mandíbulas paralelas dentro de una interfaz WebAssembly de MuJoCo, usando un teclado, un mouse, un joystick virtual o un gamepad. Los pasos de física y el renderizado de Three.js se ejecutan en el hilo de React UI, por lo que las muestras de acción de estado registradas permanecen alineadas con el simulador en lugar de con la interfaz. Todo lo caro sucede en otros lugares: renderizado en 8 GPU RTX 4090, entrenamiento y evaluación en 8 GPU A100.
Las tareas en sí se generan en lugar de ser escritas manualmente. TaskGen descompone una instrucción de lenguaje en configuraciones de tareas, escenas y objetos, recupera o genera mallas a través de una canalización de imagen a 3D, las reescala a un tamaño físico plausible y luego propone un diseño 2,5D. Un supervisor de diseño valida la escena instanciada y reubica, reorienta o regenera objetos cuando fallan las restricciones. Cada tarea viene con un verificador de éxito estructurado, que el backend vuelve a ejecutar en lugar de confiar en el indicador de éxito del frontend.
Qué contiene el conjunto de datos
La instantánea publicada contiene 207 tareas, 50.129 episodios y más de 60.000 variantes de tareas o escenas en siete categorías de escenas. Cada trayectoria contiene metadatos de la tarea, encarnación, versión del simulador, estados del robot y del objeto, acciones, etiquetas de éxito y observaciones RGB-D de tercera vista más muñeca. El periódico acredita contribuciones a más de 70.000 miembros de la comunidad.
La limpieza se trata como una etapa de producción. Las muestras con variación conjunta por debajo de 5e-3 se eliminan como estáticas, un filtro Savitzky-Golay con ventana 15 y orden polinómico 3 suaviza el movimiento continuo, y las splines cúbicas remuestrean desde los 6 Hz a los 8 Hz que la interfaz web produce hasta un objetivo de 20 Hz. La Tabla 1 es honesta acerca de la compensación: la aceleración media cae de 1,3539 a 0,4885 y el tirón medio de 11,5899 a 2,2243, mientras que el éxito de la repetición cae del 100% al 86,2%.
Los episodios limpios luego se reproducen en IsaacSim desde el estado del simulador empaquetado con los pasos físicos deshabilitados, por lo que la trayectoria verificada permanece autorizada mientras las escenas, cámaras, materiales y luces se distribuyen aleatoriamente a su alrededor. La salida es RGB con trazado de rayos de 256 × 256 desde una cámara fija de tercera vista y una cámara de muñeca, con la profundidad desactivada de forma predeterminada.
Resultados en LIBERO-Plus
Cada condición comienza desde el punto de control π0.5 liberado, una columna vertebral PaliGemma Gemma-2B con un experto en acción Gemma-300M, opcionalmente continúa el entrenamiento previo en un corpus sim y luego realiza ajustes en LIBERO con hiperparámetros idénticos. El preentrenamiento es un modelo completo sin LoRA, que utiliza una pérdida de coincidencia de flujo en fragmentos de acción de 10 pasos para 100 000 pasos, seguidos de 30 000 pasos de LIBERO después del entrenamiento.
π0.5 más AXIS-100% alcanza 88.8 en general en LIBERO-Plus contra 83.9 para vanilla π0.5 y 57.5 para un control RoboCasa365 igualado en recuento de trayectoria. El resumen cita el 5,8% y el 37,3%; ambas son cifras relativas normalizadas por la línea de base de 83,9, por lo que las brechas de puntos de 4,9 y 31,3 son la lectura más clara. El escalamiento se mantiene a nivel agregado, de 84,7 a 85,7 a 88,8 en las instantáneas del 25%, 50% y 100%.
Por eje, las mayores ganancias se obtienen donde el canal de aumento realmente es aleatorio: ruido del sensor +13,7 y cámara +11,3. El fondo gana 3.7, la pose del robot 3.8, el diseño 2.6. La Luz y el Lenguaje retroceden, en 1,7 y 1,3. La cámara también cae a 68,8 en AXIS-50%, por debajo de la línea base de 72,5, antes de recuperarse. El escalado es consistente en agregado y ruidoso por eje.
Explicador interactivo
Explicador interactivo
AXIS: un motor de datos creciente e impulsado por la comunidad para la manipulación de robots
Teleoperación del navegador, refinamiento del backend, aumento de IsaacSim y evaluación de protocolo fijo. Todas las figuras siguientes provienen del artículo de AXIS (arXiv:2607.21588).