Destacado en CVPR 2025: El papel ‘solicitante de movimiento’ de Google Deepmind desbloquea el control de video granular

Control de llave:

  • Investigadores de Google Deepmind, Universidad de Michigan y Brown, han desarrollado “indicación de movimiento”, un nuevo método para controlar la generación de videos utilizando trayectorias de movimiento específicas.
  • La técnica utiliza “indicaciones de movimiento”, una representación flexible del movimiento que puede ser escasa o densa, para guiar un modelo de difusión de video previamente capacitado.
  • Una innovación clave es la “expansión rápida de movimiento”, que traduce las solicitudes de usuarios de alto nivel, como arrastre de mouse, en instrucciones detalladas de movimiento para el modelo.
  • Este modelo único y unificado puede realizar una amplia gama de tareas, que incluyen control preciso de objetos y cámara, transferencia de movimiento de un video a otro y edición de imágenes interactivas, sin necesidad de volver a capacitarse para cada capacidad específica.

A medida que la IA generativa continúa evolucionando, obtener un control preciso sobre la creación de videos es un obstáculo crítico para su adopción generalizada en mercados como publicidad, cine y entretenimiento interactivo. Si bien las indicaciones de texto han sido el método principal de control, a menudo se quedan cortos en especificar los movimientos dinámicos y matizados que hacen que el video sea convincente. Un nuevo artículo, presentado y resaltado en CVPR 2025de Google Deepmind, la Universidad de Michigan y la Universidad de Brown introduce una solución innovadora llamada “Información de movimiento”, que ofrece un nivel de control sin precedentes al permitir a los usuarios dirigir la acción en un video utilizando trayectorias de movimiento.

Este nuevo enfoque va más allá de las limitaciones del texto, que lucha por describir los movimientos complejos con precisión. Por ejemplo, un aviso como “un oso rápidamente gira la cabeza” está abierto a innumerables interpretaciones. ¿Qué tan rápido es “rápidamente”? ¿Cuál es el camino exacto del movimiento de la cabeza? La solicitud de movimiento aborda esto al permitir que los creadores definan la moción en sí, abriendo la puerta para un contenido de video más expresivo e intencional.

Tenga en cuenta que los resultados no son en tiempo real (tiempo de procesamiento de 10 minutos)

Introducción de indicaciones de movimiento

En el núcleo de esta investigación está el concepto de un “mensaje de movimiento”. Los investigadores identificaron que las trayectorias de movimiento de español o densas espaciales, rastreando esencialmente el movimiento de puntos a lo largo del tiempo, son una forma ideal de representar cualquier tipo de movimiento. Este formato flexible puede capturar cualquier cosa, desde el aleteo sutil del cabello hasta los complejos movimientos de la cámara.

Para habilitar esto, el equipo entrenó un adaptador de control de control sobre un poderoso modelo de difusión de video previamente capacitado llamado Lumiere. El Netnet Controlnet fue entrenado en un conjunto de datos interno masivo de 2.2 millones de videos, cada uno con pistas de movimiento detalladas extraídas por un algoritmo llamado Bootstap. Esta capacitación diversa permite que el modelo comprenda y genere una amplia gama de movimientos sin ingeniería especializada para cada tarea.

Desde simples clics hasta escenas complejas: expansión rápida de movimiento

Si bien especificar cada punto de movimiento para una escena compleja no sería práctico para un usuario, los investigadores desarrollaron un proceso que llaman “expansión rápida de movimiento”. Este inteligente sistema traduce las entradas simples de los usuarios de alto nivel en el movimiento detallado y semidenso solicita las necesidades del modelo.

Esto permite una variedad de aplicaciones intuitivas:

“Interactuar” con una imagen: Un usuario puede simplemente hacer clic y arrastrar su mouse a través de un objeto en una imagen fija para que se mueva. Por ejemplo, un usuario podría arrastrar la cabeza de un loro para que gire, o “reproducir” con el cabello de una persona, y el modelo genera un video realista de esa acción. Curiosamente, este proceso reveló comportamientos emergentes, donde el modelo generaría un movimiento físicamente plausible, como la arena que se dispersa de manera realista cuando el cursor “presiona”.

Control de objeto y cámara: Al interpretar los movimientos del mouse como instrucciones para manipular un primitivo geométrico (como una esfera invisible), los usuarios pueden lograr un control de grano fino, como girar con precisión la cabeza de un gato. Del mismo modo, el sistema puede generar movimientos sofisticados de la cámara, como orbitar una escena, estimando la profundidad de la escena desde el primer cuadro y proyectando una ruta de cámara deseada. El modelo incluso puede combinar estas indicaciones para controlar un objeto y la cámara simultáneamente.

Transferencia de movimiento: Esta técnica permite que el movimiento de un video de origen se aplique a un tema completamente diferente en una imagen estática. Por ejemplo, los investigadores demostraron transferir los movimientos de la cabeza de una persona a un macaco, efectivamente “titiritiendo” al animal.

Poniéndolo a prueba

El equipo realizó extensas evaluaciones cuantitativas y estudios en humanos para validar su enfoque, comparándolo con modelos recientes como conductor de imagen y draganything. En casi todas las métricas, incluida la calidad de imagen (PSNR, SSIM) y la precisión del movimiento (EPE), su modelo superó a las líneas de base.

Un estudio humano confirmó aún más estos resultados. Cuando se les pidió que elijan entre videos generados por la solicitud de movimiento y otros métodos, los participantes preferían constantemente los resultados del nuevo modelo, citando una mejor adherencia a los comandos de movimiento, un movimiento más realista y una calidad visual general más alta.

Limitaciones y direcciones futuras

Los investigadores son transparentes sobre las limitaciones actuales del sistema. A veces, el modelo puede producir resultados antinaturales, como estirar un objeto de manera no natural si partes de él se “bloquean” erróneamente en el fondo. Sin embargo, sugieren que estas mismas fallas pueden usarse como una herramienta valiosa para investigar el modelo de video subyacente e identificar las debilidades en su “comprensión” del mundo físico.

Esta investigación representa un paso significativo hacia la creación de modelos de video generativos verdaderamente interactivos y controlables. Al centrarse en el elemento fundamental del movimiento, el equipo ha desbloqueado una herramienta versátil y poderosa que algún día podría convertirse en un estándar para profesionales y creativos que buscan aprovechar todo el potencial de IA en la producción de video.


Mira el Papel y Página del proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.


Jean-Marc es un exitoso ejecutivo de negocios de IA. Dirige y acelera el crecimiento de las soluciones de IA y comenzó una compañía de visión por computadora en 2006. Es un orador reconocido en AI Conferences y tiene un MBA de Stanford.