¿Cómo se construye un modelo de acción de lenguaje de visión única que pueda controlar muchos robots de dos brazos diferentes en el mundo real? LingBot-VLA es el nuevo modelo básico Vision Language Action de Ant Group Robbyant que apunta a la manipulación práctica de robots en el mundo real. Está capacitado en aproximadamente 20.000 horas de datos bimanuales teleoperados recopilados de 9 realizaciones de robots de doble brazo y se evalúa en el punto de referencia GM-100 a gran escala en 3 plataformas. El modelo está diseñado para la generalización de morfología cruzada, postentrenamiento eficiente de datos y alto rendimiento de entrenamiento en clústeres de GPU básicos.
Conjunto de datos de doble brazo a gran escala en 9 realizaciones de robots
El conjunto de datos previo al entrenamiento se construye a partir de teleoperaciones del mundo real en 9 configuraciones populares de brazo dual. Estos incluyen AgiBot G1, AgileX, Galaxea R1Lite, Galaxea R1Pro, Realman Rs 02, Leju KUAVO 4 Pro, Qinglong humanoid, ARX Lift2 y una configuración Bimanual Franka. Todos los sistemas tienen brazos duales de 6 o 7 grados de libertad con pinzas paralelas y múltiples cámaras RGB-D que brindan observaciones de múltiples vistas.
La teleoperación utiliza control VR para AgiBot G1 y control de brazo isomórfico para AgileX. Para cada escena, los anotadores humanos segmentan los vídeos grabados de todas las vistas en clips que corresponden a acciones atómicas. Los fotogramas estáticos al principio y al final de cada clip se eliminan para reducir la redundancia. Las instrucciones de lenguaje a nivel de tarea y subtarea se generan con Qwen3-VL-235B-A22B. Este canal produce secuencias sincronizadas de imágenes, instrucciones y trayectorias de acción para el entrenamiento previo.
Para caracterizar la diversidad de acciones, el equipo de investigación visualiza las acciones atómicas más frecuentes en entrenamientos y pruebas a través de nubes de palabras. Alrededor del 50 por ciento de las acciones atómicas en el conjunto de prueba no aparecen dentro de las 100 acciones más frecuentes en el conjunto de entrenamiento. Esta brecha asegura que la evaluación enfatice la generalización de tareas cruzadas en lugar de la memorización basada en la frecuencia.
Acciones de Arquitectura, Mezcla de Transformadores y Coincidencia de Flujo
LingBot-VLA combina una sólida columna vertebral multimodal con un experto en acción a través de una arquitectura Mixture of Transformers. La columna vertebral del lenguaje visual es Qwen2.5-VL. Codifica imágenes operativas de múltiples vistas y la instrucción en lenguaje natural en una secuencia de tokens multimodales. Paralelamente, el experto en acciones recibe el estado propioceptivo del robot y fragmentos de acciones pasadas. Ambas ramas comparten un módulo de autoatención que realiza un modelado de secuencia conjunta por capas sobre tokens de observación y acción.
En cada paso de tiempo, el modelo forma una secuencia de observación que concatena tokens de 3 vistas de cámara, la instrucción de la tarea y el estado del robot. La secuencia de acción es un fragmento de acción futura con un horizonte temporal establecido en 50 durante el entrenamiento previo. El objetivo de la formación es la coincidencia de flujo condicional. El modelo aprende un campo vectorial que transporta el ruido gaussiano a la trayectoria de acción de la verdad fundamental a lo largo de una ruta de probabilidad lineal. Esto proporciona una representación de acción continua y produce un control suave y temporalmente coherente adecuado para una manipulación precisa de dos brazos.
LingBot-VLA utiliza atención causal en bloques sobre la secuencia conjunta. Los tokens de observación pueden atenderse entre sí de forma bidireccional. Las fichas de acción pueden atender a todas las fichas de observación y solo a las fichas de acción pasadas. Esta máscara evita la fuga de información de acciones futuras a observaciones actuales y al mismo tiempo permite al experto en acciones explotar todo el contexto multimodal en cada paso de decisión.
Percepción espacial a través de la destilación de profundidad LingBot
Muchos modelos VLA tienen dificultades con el razonamiento de profundidad cuando los sensores de profundidad fallan o devuelven mediciones escasas. LingBot-VLA aborda esto integrando LingBot-Depth, un modelo de percepción espacial independiente basado en el modelado de profundidad enmascarado. LingBot-Depth se entrena de forma autosupervisada en un gran corpus RGB-D y aprende a reconstruir una profundidad métrica densa cuando partes del mapa de profundidad están enmascaradas, a menudo en regiones donde los sensores físicos tienden a fallar.
En LingBot-VLA, las consultas visuales de cada vista de cámara se alinean con tokens LingBot-Depth a través de una capa de proyección y una pérdida de destilación. La atención cruzada asigna las consultas de VLM al espacio latente de profundidad y el entrenamiento minimiza su diferencia con las funciones de LingBot-Depth. Esto inyecta información geométrica en la política y mejora el rendimiento en tareas que requieren un razonamiento espacial 3D preciso, como inserción, apilamiento y plegado bajo desorden y oclusión.
Punto de referencia del mundo real GM-100 en 3 plataformas
La evaluación principal utiliza GM-100, un punto de referencia del mundo real con 100 tareas de manipulación y 130 trayectorias teleoperadas filtradas por tarea en cada una de las 3 plataformas de hardware. Los experimentos comparan LingBot-VLA con π0.5, GR00T N1.6 y WALL-OSS bajo un protocolo compartido posterior al entrenamiento. Todos los métodos se ajustan desde puntos de control públicos con el mismo conjunto de datos, tamaño de lote 256 y 20 épocas. La tasa de éxito mide la finalización de todas las subtareas en 3 minutos y la puntuación de progreso rastrea la finalización parcial.
En GM-100, LingBot-VLA con profundidad logra promedios de última generación en las 3 plataformas. La tasa de éxito promedio es del 17,30 por ciento y la puntuación de progreso promedio es del 35,41 por ciento. π0,5 alcanza un 13,02 por ciento de SR (tasa de éxito) y un 27,65 por ciento de PS (puntuación de progreso). GR00T N1.6 y WALL-OSS son más bajos con 7,59 por ciento SR, 15,99 por ciento PS y 4,05 por ciento SR, 10,35 por ciento PS respectivamente. LingBot-VLA sin profundidad ya supera a GR00T N1.6 y WALL-OSS y la variante de profundidad agrega más ganancias.
En la simulación RoboTwin 2.0 con 50 tareas, los modelos se entrenan en 50 demostraciones por tarea en escenas limpias y 500 por tarea en escenas aleatorias. LingBot-VLA con profundidad alcanza una tasa de éxito promedio del 88,56 por ciento en escenas limpias y del 86,68 por ciento en escenas aleatorias. π0,5 alcanza el 82,74 por ciento y el 76,76 por ciento en los mismos entornos. Esto muestra ganancias consistentes a partir de la misma arquitectura e integración profunda cuando la aleatorización de dominios es fuerte.
Comportamiento de escalamiento y capacitación posterior eficiente en datos
El equipo de investigación analiza las leyes de escala variando los datos previos al entrenamiento de 3000 a 20 000 horas en un subconjunto de 25 tareas. Tanto la tasa de éxito como la puntuación de progreso aumentan monótonamente con el volumen de datos, sin saturación en la escala más grande estudiada. Esta es la primera evidencia empírica de que los modelos VLA mantienen una escala favorable en datos de robots reales de este tamaño.
También estudian la eficiencia de los datos del entrenamiento posterior en AgiBot G1 utilizando 8 tareas representativas del GM-100. Con solo 80 demostraciones por tarea, LingBot-VLA ya supera π0,5 que utiliza el conjunto completo de 130 demostraciones, tanto en tasa de éxito como en puntuación de progreso. A medida que se agregan más trayectorias, la brecha de desempeño se amplía. Esto confirma que la política previamente capacitada se transfiere con solo docenas a alrededor de 100 trayectorias específicas de tareas, lo que reduce directamente el costo de adaptación para nuevos robots o tareas.
Rendimiento de la capacitación y kit de herramientas de código abierto
LingBot-VLA viene con una pila de capacitación optimizada para la eficiencia de múltiples nodos. El código base utiliza una estrategia de estilo FSDP para parámetros y estados del optimizador, fragmentación híbrida para el experto en acciones, precisión mixta con reducciones float32 y almacenamiento bfloat16, y aceleración a nivel de operador con núcleos de atención fusionados y compilación de antorcha.
En una configuración de 8 GPU, el equipo de investigación informó un rendimiento de 261 muestras por segundo por GPU para las configuraciones de los modelos Qwen2.5-VL-3B y PaliGemma-3B-pt-224. Esto corresponde a una aceleración de 1,5 a 2,8 veces en comparación con las bases de código orientadas a VLA existentes, como StarVLA, Dexbotic y OpenPI, evaluadas en el mismo punto de referencia basado en Libero. El rendimiento aumenta casi linealmente cuando se pasa de 8 a 256 GPU. El conjunto de herramientas completo posterior a la capacitación se publica como código abierto.
Conclusiones clave
LingBot-VLA es un modelo básico de acción de lenguaje de visión basado en Qwen2.5-VL entrenado en aproximadamente 20,000 horas de teleoperación de doble brazo en el mundo real en 9 realizaciones de robots, lo que permite una fuerte morfología cruzada y generalización de tareas cruzadas. El modelo integra LingBot Depth a través de la destilación de características para que los tokens de visión se alineen con un experto en finalización de profundidad, lo que mejora significativamente la comprensión espacial 3D para la inserción, el apilamiento, el plegado y otras tareas sensibles a la geometría. En el punto de referencia del mundo real GM-100, LingBot-VLA con profundidad logra una tasa de éxito promedio de alrededor del 17,30 por ciento y una puntuación de progreso promedio del 35,41 por ciento, que es superior a π0,5, GR00T N1.6 y WALL OSS bajo el mismo protocolo posterior al entrenamiento. LingBot-VLA muestra una alta eficiencia de datos en el entrenamiento posterior, ya que en AgiBot G1 puede superar π0.5 que usa 130 demostraciones por tarea mientras usa solo alrededor de 80 demostraciones por tarea, y el rendimiento continúa mejorando a medida que se agregan más trayectorias.
Consulte la página de papel, peso del modelo, repositorio y proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.