Salesforce AI presenta FOFPred: un marco de predicción de flujo óptico futuro basado en lenguaje que permite un mejor control de robots y generación de videos

El equipo de investigación de IA de Salesforce presenta FOFPred, un marco de predicción de flujo óptico futuro impulsado por lenguaje que conecta modelos de lenguaje de visión grande con transformadores de difusión para pronóstico de movimiento denso en entornos de control y generación de video. FOFPred toma una o más imágenes y una instrucción en lenguaje natural, como “mover la botella de derecha a izquierda”, y predice 4 cuadros de flujo óptico futuros que describen cómo se espera que se mueva cada píxel con el tiempo.

https://arxiv.org/pdf/2601.10781

El flujo óptico futuro como representación del movimiento.

El flujo óptico es el desplazamiento aparente por píxel entre dos fotogramas. FOFPred se centra en el flujo óptico futuro, lo que significa predecir campos de desplazamiento densos para fotogramas futuros teniendo en cuenta únicamente las observaciones y el texto actuales, sin acceso a imágenes futuras en la inferencia.

El flujo óptico futuro es una representación de movimiento compacto únicamente. Elimina la apariencia estática y mantiene solo el movimiento a nivel de píxeles, por lo que es muy adecuado como estado intermedio para políticas de control de robots y como señal condicionante para modelos de difusión de video. En comparación con la predicción de fotogramas RGB futuros, reduce la complejidad de la distribución de salida y evita el modelado de texturas y detalles de alta frecuencia que no son necesarios para la planificación del movimiento.

Para conectarse a la infraestructura de difusión latente existente, el equipo de investigación codifica el flujo óptico como imágenes RGB. Mapean la magnitud y dirección del flujo desde la forma polar a canales HSV y luego los convierten a RGB. La escala de cada canal se ajusta para que los fotogramas de flujo consecutivos sean visualmente suaves y parezcan gráficos animados. Luego, un codificador automático variacional Flux.1 estándar codifica y decodifica estas imágenes de flujo.

Red troncal de difusión VLM unificada

FOFPred utiliza una arquitectura unificada que combina un modelo de lenguaje de visión congelado, un VAE congelado y un transformador de difusión entrenable. El oleoducto es:

Qwen2.5-VL se utiliza como codificador de lenguaje de visión para codificar conjuntamente los subtítulos y las entradas visuales. Flux.1 VAE codifica las imágenes de entrada y los objetivos de flujo óptico de entrenamiento en tensores latentes. Un transformador de difusión estilo OmniGen, DiT, toma características visuales y textuales proyectadas como entradas condicionales y genera secuencias de flujo futuras latentes.

Sólo los proyectores DiT y MLP pequeños están capacitados. Los pesos de Qwen2.5-VL y Flux.1 permanecen congelados, lo que permite que el modelo reutilice el entrenamiento previo de edición de imágenes y la capacidad de razonamiento multimodal de trabajos anteriores. El modelado temporal se agrega extendiendo la codificación posicional de RoPE y los bloques de atención desde posiciones espaciales bidimensionales a posiciones espacio-temporales completas a través de secuencias de cuadros de entrada y salida. Esto brinda atención espacio-temporal completa sin agregar parámetros adicionales, por lo que DiT puede reutilizar el entrenamiento previo de imágenes de OmniGen directamente.

https://arxiv.org/pdf/2601.10781

Entrenamiento sobre videos web ruidosos con flujo óptico relativo

El modelo central se entrena en vídeos de actividad humana a escala web con subtítulos emparejados. El equipo de investigación utiliza el conjunto de datos Something Something V2 y el conjunto de datos de manipulación egocéntrica EgoDex para obtener alrededor de 500.000 pares de subtítulos de vídeo.

El entrenamiento utiliza un objetivo de coincidencia de flujo de extremo a extremo en el espacio latente. Las futuras secuencias de flujo óptico se calculan primero fuera de línea, luego el VAE las codifica y las utiliza como objetivos en una pérdida de difusión que coincide con el flujo para el DiT. Durante el entrenamiento, el método también aplica una guía gratuita del clasificador tanto en el texto como en las condiciones visuales y enmascara algunos marcos y puntos de vista para mejorar la solidez.

Una contribución fundamental es el cálculo del flujo óptico relativo utilizado para crear objetivos de entrenamiento limpios a partir de vídeos ruidosos y egocéntricos. Para cada par de cuadros el método:

Calcula el flujo óptico denso con un estimador disponible en el mercado. Estima el movimiento de la cámara mediante homografía utilizando funciones profundas. Utiliza geometría proyectiva para restar el movimiento de la cámara y obtener vectores de flujo relativos centrados en el objeto. Filtra pares de fotogramas seleccionando aquellos en los que las magnitudes de flujo del k porcentaje superior superan un umbral, lo que centra el entrenamiento en segmentos con movimiento significativo.

Estos pasos se ejecutan fuera de línea con una resolución más baja para mayor eficiencia y luego se vuelven a calcular con la resolución original para los objetivos finales. El estudio de ablación muestra que los objetivos de fotogramas estáticos o el flujo bruto sin eliminación del movimiento de la cámara perjudican el rendimiento posterior, mientras que los objetivos de flujo relativo desenredados dan los mejores resultados.

https://arxiv.org/pdf/2601.10781

Manipulación de robots impulsada por el lenguaje

El primer caso de uso posterior es el control de robots. FOFPred se ajusta a los datos de subtítulos de vídeo del robot para predecir el flujo óptico futuro de cámaras fijas y montadas en la muñeca. Además de FOFPred, el equipo de investigación adjunta una red de políticas de difusión que toma el flujo predicho, el texto y el estado del robot, y genera acciones continuas. Esta configuración sigue un trabajo de política de difusión anterior, pero utiliza el flujo óptico futuro en lugar de los fotogramas RGB previstos como representación principal.

En el punto de referencia CALVIN ABCD, que evalúa cadenas de tiro cero de largo horizonte de cinco tareas de manipulación de lenguaje específico, FOFPred alcanza una longitud de cadena promedio de 4,48. VPP llega a 4,33 y DreamVLA llega a 4,44 bajo el mismo protocolo. FOFPred también logra una tasa de éxito de la Tarea 5 del 78,7 por ciento, que es la mejor entre los métodos reportados. En un entorno de datos bajos con un 10 por ciento de manifestaciones de CALVIN, FOFPred aún alcanza una duración promedio de 3,43, superior a los 3,25 de VPP.

En RoboTwin 2.0, un punto de referencia de manipulación de dos brazos con 5 tareas que requieren ambos brazos, FOFPred logra una tasa de éxito promedio del 68,6 por ciento. La línea de base del VPP alcanza el 61,8 por ciento en entornos de entrenamiento idénticos. FOFPred mejora el éxito en cada tarea del subconjunto.

https://arxiv.org/pdf/2601.10781

Generación de texto a vídeo con reconocimiento de movimiento

La segunda tarea posterior es el control de movimiento en la generación de texto a video. El equipo de investigación construyó un canal de dos etapas conectando FOFPred con el modelo de difusión de video Go with the Flow. FOFPred toma un cuadro inicial y una descripción lingüística del movimiento, predice una secuencia de cuadros de flujo futuros y los interpola en un campo de movimiento denso. Go with the Flow luego usa este campo de movimiento y el cuadro inicial para sintetizar el video final, aplicando el patrón de movimiento descrito.

En el punto de referencia Something Something V2 con mucho movimiento, el FOFPred junto con el canal Go with the Flow mejora con respecto a la línea de base de CogVideoX en condiciones idénticas. El método alcanza SSIM 68.4, PSNR 22.26, LPIPS 28.5, FVD 75.39, KVD 11.38 y fidelidad de movimiento 0.662, que son consistentemente mejores que CogVideoX. Es importante destacar que FOFPred solo usa lenguaje y un solo cuadro en la inferencia, mientras que varias líneas base de video controlables requieren máscaras o trayectorias de manos u objetos como entradas adicionales.

https://arxiv.org/pdf/2601.10781

Conclusiones clave

FOFPred reformula la predicción de movimiento como un flujo óptico futuro impulsado por el lenguaje, prediciendo 4 cuadros de flujo óptico densos a partir de una o más imágenes actuales y una instrucción de texto, lo que proporciona una representación compacta de solo movimiento para tareas posteriores. El modelo utiliza una columna vertebral de difusión VLM unificada, con Qwen2.5-VL como codificador de lenguaje de visión congelado, Flux.1-VAE como codificador latente congelado para imágenes y flujo, y un DiT estilo OmniGen como el único componente entrenado con atención basada en RoPE espacio-temporal. La capacitación se basa en videos web y egocéntricos a gran escala de Something Something-V2 y EgoDex, y construye objetivos de flujo óptico relativo estimando el movimiento del ego a través de la homografía, restando el flujo de la cámara y filtrando segmentos de alto movimiento, lo que mejora significativamente el rendimiento posterior. En la manipulación de robots, FOFPred actúa como columna vertebral de movimiento para un jefe de política de difusión y logra resultados de última generación o mejores en CALVIN ABCD y RoboTwin 2.0, incluida una longitud promedio de cadena de tareas de 4,48 en CALVIN y un éxito promedio de 68,6 por ciento en RoboTwin, superando las variantes de VPP y DreamVLA. Para la generación de texto a video, conectar FOFPred a Go with the Flow produce mejores métricas SSv2 que CogVideoX, con SSIM y PSNR más altos, FVD y KVD más bajos y fidelidad de movimiento mejorada, al tiempo que requiere solo lenguaje y un solo cuadro en la inferencia, lo que convierte a FOFPred en un controlador de movimiento reutilizable tanto para robótica como para procesos de síntesis de video.

Consulte el documento, el modelo y el repositorio. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.