Reward AI, una startup de robótica cuyo trabajo anterior de equipo incluye DexCap, HumanPlus y ALOHA, ha lanzado OM-1, abreviatura de Omnibody Model 1. OM-1 es una política de manipulación de propósito general que aprende de los humanos que usan un guante sensorizado y luego corre con brazos industriales y humanoides a velocidad humana. Los hallazgos clave que destacan: no se utilizan datos de teleoperación ni datos del robot en el entrenamiento. El sistema sigue un principio: “Un modelo, una interfaz de datos, cualquier organismo”.
¿Es desplegable? No, OM-1 es la política interna de Reward AI. No se han publicado pesos, códigos, conjuntos de datos ni API, por lo que los desarrolladores aún no pueden ejecutarlo en su propio hardware.
¿Por qué omitir los datos del robot?
La mayoría de las políticas de la fundación de robots se basan en datos de robots teleoperados o recopilados por ellos mismos, lo que vincula el conjunto de datos a una realización. Reward AI sostiene que la manipulación a nivel humano no provendrá de más datos o más computación, citando “More Is Different” de Anderson. En cambio, la captura, el aprendizaje y el control están diseñados como un solo proceso, por lo que las demostraciones grabadas hoy pueden entrenar cuerpos de robots que aún no existen.
Mano omnicuerpo: un dispositivo portátil de 7 grados de libertad
La pila comienza con Omnibody Hand, un dispositivo portátil que amplía el trabajo anterior de DexCap del equipo sobre captura de movimiento portátil. En lugar de copiar la mano humana articulación por articulación, es un diseño de siete grados de libertad construido alrededor de las funciones que importan: elegir puntos de contacto, reorientar objetos en la mano y moverse entre agarres precisos y potentes. Capta el pellizco del pulgar-índice, la flexión del pulgar y el índice, y el movimiento acoplado de los dedos medio, anular y meñique en las articulaciones MCP.
La ergonomía se trata como una cuestión de calidad de los datos: un dispositivo que se desliza o restringe al usuario produce un agarre compensado. Un mecanismo de flexión distal absorbe las diferencias en la longitud de los dedos, por lo que no es necesario ningún ajuste por usuario.
One Data Interface convierte el movimiento del usuario en datos de entrenamiento sin configuración por etapas ni supervisor. El objetivo del diseño es la clasificación mediante cinta transportadora, donde una persona detecta, agarra y arroja un objeto en una fracción de segundo. Para cubrir toda la interacción, el guante combina detección táctil de alta frecuencia, detección de proximidad para el acercamiento previo al contacto y cámaras en la mano con obturador global que mantienen el contexto a través de movimientos rápidos.
El seguimiento de la postura de la mano es donde Reward AI informa su primer resultado cuantitativo. El seguimiento visual-inercial es el valor predeterminado común, pero su precisión en reversiones rápidas está limitada por la tasa de actualización visual. La IA de recompensa lo aumenta con detección electromagnética más compensación de perturbaciones. Al mover ambos rastreadores entre dos topes mecánicos a ocho velocidades de 3 a 67 cm/s, con un promedio de diez carreras cada uno, el seguimiento electromagnético aumentó de aproximadamente 0,4 mm a 9,5 mm de error de sobrepaso medio, mientras que el visual-inercial aumentó de aproximadamente 2,1 mm a 24,9 mm: una reducción del 60% a la velocidad más alta, con una dispersión más estrecha entre carreras. La fuerza se registra a lo largo de la misma trayectoria, por lo que las demostraciones conllevan tanto esfuerzo como trayectoria.
OM-1: Una política, capacitación en una sola etapa
OM-1 aprende a generar acciones del robot directamente a partir del movimiento humano en lugar de enrutar el comportamiento a través de un robot intermedio. Debido a que cada manifestación llega en el mismo formato, no hay división entre la capacitación previa y posterior: la primera manifestación jamás registrada y la más nueva entrenan una sola política en una sola etapa.
Las entradas son los flujos multimodales del guante: imágenes, señales táctiles, proximidad entre dedos y trayectorias de postura de las manos. Cada modalidad se procesa a la frecuencia de muestreo nativa de su sensor en lugar de reducirse a una frecuencia común, por lo que las señales táctiles y de movimiento de alta frecuencia sobreviven junto con la visión de baja frecuencia. Las salidas transmiten la dirección del movimiento, la velocidad, la fuerza y el momento de eventos como el inicio del agarre. Reward AI dice que construyó una arquitectura novedosa para una inferencia eficiente, aunque no se revelan los detalles arquitectónicos ni el recuento de parámetros.
Controle cualquier cuerpo: una capa RL en su propio reloj
Debajo de la política se encuentra una capa de control de alta frecuencia entrenada con aprendizaje de refuerzo en simulación para manejar dinámicas dependientes de la velocidad y la aceleración, perturbaciones externas y retrasos del sistema. Mientras que un controlador clásico expulsado de su referencia por una carga inesperada nunca se recupera, esta capa retiene la referencia y se asienta, que es lo que permite a un robot abrir la puerta de un refrigerador completamente cerrada o levantar cajas de peso desconocido.
La capa de control funciona según su propio reloj y continúa mientras la política calcula las siguientes acciones, por lo que la latencia de inferencia nunca detiene el movimiento. Debido a que es posible que las predicciones sucesivas no se unan sin problemas, optimiza la transición entre ellas en línea. El mismo espacio de acción cubre la manipulación y navegación para robots móviles.
Resultados
Reward AI informa que OM-1 asume una tarea completamente nueva, que incluye dinámicas desafiantes y horizontes largos, a partir de menos de 30 minutos de datos humanos, y lo atribuye a la pila integrada en lugar de a la política sola. Su página acerca de indica que todos los clips publicados se ejecutan a una velocidad 1x y que el modelo abarca brazos, humanoides con piernas y manipuladores móviles con ruedas. No se han publicado tasas de éxito, comparaciones de referencias públicas ni documentos, por lo que estas afirmaciones están respaldadas por demostraciones y no por puntos de referencia.