Conozca Qwen-RobotSuite: tres modelos de IA incorporados para manipulación de VLA, modelado de mundos en video y navegación

El equipo de Qwen ha lanzado tres modelos de IA incorporados, agrupados como Qwen-Robot-Suite. Los tres son Qwen-RobotManip, Qwen-RobotWorld y Qwen-RobotNav. Cada uno está construido sobre una columna vertebral de lenguaje de visión Qwen y apunta a un problema robótico diferente.

Qwen-RobotManip es un modelo de manipulación Visión-Lenguaje-Acción, construido sobre Qwen3.5-4B. Qwen-RobotWorld es un modelo de mundo de vídeo condicionado por el lenguaje con un MMDiT de 60 capas y un codificador Qwen2.5-VL congelado. Qwen-RobotNav es un modelo de navegación basado en Qwen3-VL, disponible en tamaños 2B, 4B y 8B.

Qwen-Robot-Suite

Qwen-Robot-Suite no es un modelo único. Es un conjunto de tres modelos de cimentación independientes. Dos de ellos, RobotManip y RobotNav, se envían con repositorios públicos de GitHub.

Los datos de robótica están fragmentados entre hardware y tareas. Diferentes robots utilizan formatos de observación y acción incompatibles. Una política formada en un brazo rara vez se transfiere al otro.

Los tres informes de investigación abordan esta fragmentación de diferentes maneras. RobotManip alinea las representaciones de acciones para que los datos de manipulación se escalen. RobotWorld utiliza el lenguaje como una interfaz de acción unificada para la predicción de videos. RobotNav expone una interfaz de observación controlable para tareas de navegación.

Aquí está la división principal entre los tres lanzamientos:

ModeloProblemaBackboneSalidaQwen-RobotManipManipulación robóticaQwen3.5-4B (Qwen-VL)Acciones continuas del robotQwen-RobotMundoModelado de mundos incorporadosFrozen Qwen2.5-VLVideo futuro previstoQwen-RobotNavNavegación móvilQwen3-VL (2B/4B/8B)Trayectorias de waypoints

Qwen-RobotManip: la alineación desbloquea la escala para la manipulación

Qwen-RobotManip es un modelo básico de Visión-Lenguaje-Acción (VLA). Está construido sobre Qwen-VL y predice acciones continuas del robot.

Un modelo VLA toma vistas de cámara e instrucción de idioma. Luego genera acciones de robot de bajo nivel. El desafío es que los datos manipulados son heterogéneos por naturaleza.

Diferentes robots registran estados y acciones en formatos incompatibles. Cuando las demostraciones llegan con representaciones no coincidentes, la escala de datos produce interferencia. RobotManip resuelve esto con un marco de alineación unificado.

El marco de alineación unificado

El marco tiene tres mecanismos complementarios. La primera es una representación canónica de acción-estado. Es un vector de 80 dimensiones con enmascaramiento binario por dimensión.

Este vector contiene dos bloques por brazo de 29 dimensiones más 22 dimensiones reservadas. Cada bloque almacena posiciones de las articulaciones, postura del efector final, estado de agarre y articulaciones de las manos diestras. Los robots pueblan sólo las dimensiones que tienen.

En segundo lugar está la parametrización de la pose delta del fotograma de la cámara. Las acciones del efector final se expresan como deltas en el cuadro de la cámara. Esto hace que movimientos visualmente similares sean numéricamente próximos en todas las realizaciones.

En tercer lugar está un mecanismo de adaptación de políticas en contexto. Lee el historial de ejecución reciente como un identificador de realización implícito. La política ajusta el comportamiento en el momento de la implementación sin actualizaciones de parámetros.

A esto se suma una estrategia de formación conjunta de doble flujo. Optimiza conjuntamente los datos de manipulación y el flujo visión-lenguaje. Esto evita que la percepción y el razonamiento de la columna vertebral se erosionen.

El motor de datos

RobotManip reúne aproximadamente 38.100 horas de datos de manipulación. Utiliza únicamente conjuntos de datos de código abierto y vídeos humanos. No se utilizó ninguna recopilación de datos de propiedad exclusiva.

Un proceso de síntesis de humano a robot produce la mayor parte de esta escala. Convierte demostraciones manuales egocéntricas en trayectorias de robots. El proceso se renderiza en 15 plataformas robóticas.

Sólo esta síntesis arroja alrededor de 24.808 horas de demostraciones. Los datos de la fuente egocéntrica son de aproximadamente 1.933 horas. Los conjuntos de datos de robots de código abierto aportan más de 11.000 horas.

El proceso separa la alineación de acciones de la alineación visual. La alineación de acciones redirige los puntos clave de las manos a posturas de agarre. La alineación visual utiliza enmascaramiento SAM3, pintura interna ProPainter y cinemática inversa de MuJoCo.

Luego, un proceso de curación de cinco etapas filtra el corpus combinado. Detecta cambios repentinos, desalineaciones temporales y valores extremos. Una verificación encontró que el 81% de los episodios en un subconjunto fallaron en la alineación entre estado y acción.

Resultados de referencia

El informe de investigación sostiene que los puntos de referencia estándar no miden la generalización. Los modelos sin entrenamiento previo de robot coinciden con los modelos previamente entrenados en pruebas en distribución. Por lo tanto, RobotManip se centra en entornos fuera de distribución (OOD).

Índice de referencia (OOD)Anterior. SOTA (π0.5)Qwen-RobotManipLIBERO-Plus84.491.4RoboTwin-C2R Hard47.969.4EBench27.145.6RoboCasa36516.935.9RoboTwin-IF49.672.2

La mayor brecha reportada se refiere a la transferencia entre encarnaciones. RobotManip alcanza el 23,9 % utilizando acciones EEF en el marco de la cámara. Esto es 3,2 veces el 7,5% logrado por π0,5.

El modelo también ocupa el primer lugar en la pista generalista RoboChallenge Table30-v1. Obtiene una mejora relativa del 20% con respecto al mejor anterior. La validación de robots reales cubre las plataformas AgileX ALOHA, Franka, UR y ARX.