El equipo de IA de Netflix acaba de abrir VOID: un modelo de IA que borra objetos de vídeos: física y todo

La edición de vídeo siempre ha tenido un sucio secreto: eliminar un objeto del metraje es fácil; hacer que la escena parezca como si nunca hubiera existido es brutalmente difícil. Si eliminas a una persona que sostiene una guitarra, te quedarás con un instrumento flotante que desafía la gravedad. Los equipos de efectos visuales de Hollywood pasan semanas solucionando exactamente este tipo de problema. Un equipo de investigadores de Netflix e INSAIT, de la Universidad de Sofía ‘St. Kliment Ohridski’, lanzó el modelo VOID (Eliminación de interacciones y objetos de video) que puede hacerlo automáticamente.

VOID elimina objetos de los videos junto con todas las interacciones que inducen en la escena; no solo efectos secundarios como sombras y reflejos, sino interacciones físicas como objetos que caen cuando se elimina a una persona.

¿Qué problema está resolviendo realmente VOID?

Los modelos estándar de pintura de vídeo, del tipo que se utiliza en la mayoría de los flujos de trabajo de edición actuales, están entrenados para rellenar la región de píxeles donde estaba un objeto. Son esencialmente pintores de fondos muy sofisticados. Lo que no hacen es razonar sobre la causalidad: si elimino a un actor que sostiene un objeto, ¿qué debería pasar con ese objeto?

Los métodos de eliminación de objetos de vídeo existentes destacan por pintar contenido “detrás” del objeto y corregir artefactos a nivel de apariencia, como sombras y reflejos. Sin embargo, cuando el objeto eliminado tiene interacciones más significativas, como colisiones con otros objetos, los modelos actuales no logran corregirlas y producen resultados inverosímiles.

VOID está construido sobre CogVideoX y ajustado para video en pintura con acondicionamiento de máscara consciente de la interacción. La innovación clave está en cómo el modelo entiende la escena, no solo en “¿qué píxeles debo rellenar?”. pero ‘¿qué es físicamente plausible después de que este objeto desaparezca?’

El ejemplo canónico del trabajo de investigación: si se retira a una persona que sostiene una guitarra, VOID también elimina el efecto de la persona sobre la guitarra, provocando que ésta caiga naturalmente. Eso no es trivial. El modelo tiene que entender que la guitarra estaba siendo sostenida por la persona y que al retirarla significa que la gravedad se hace cargo.

Y a diferencia de trabajos anteriores, VOID se evaluó cara a cara con competidores reales. Los experimentos con datos sintéticos y reales muestran que el enfoque preserva mejor la dinámica de la escena consistente después de la eliminación de objetos en comparación con los métodos de eliminación de objetos de video anteriores, incluidos ProPainter, DiffuEraser, Runway, MiniMax-Remover, ROSE y Gen-Omnimatte.

https://arxiv.org/pdf/2604.02296

La arquitectura: CogVideoX bajo el capó

VOID se basa en CogVideoX-Fun-V1.5-5b-InP, un modelo de Alibaba PAI, y está optimizado para video inpainting con acondicionamiento de máscara cuádruple consciente de la interacción. CogVideoX es un modelo de generación de vídeo basado en 3D Transformer. Piense en ello como una versión en video de Stable Diffusion: un modelo de difusión que opera sobre secuencias temporales de fotogramas en lugar de imágenes individuales. Alibaba PAI lanza el modelo base específico (CogVideoX-Fun-V1.5-5b-InP) en Hugging Face, que es el punto de control que los ingenieros deberán descargar por separado antes de ejecutar VOID.

Las especificaciones de arquitectura afinadas: un transformador CogVideoX 3D con parámetros 5B, captura de video, máscara cuádruple y un mensaje de texto que describe la escena después de la eliminación como entrada, operando a una resolución predeterminada de 384 × 672, procesando un máximo de 197 fotogramas, usando el programador DDIM y ejecutándose en BF16 con cuantificación FP8 para eficiencia de la memoria.

La máscara cuádruple es posiblemente la contribución técnica más interesante aquí. En lugar de una máscara binaria (eliminar este píxel/mantener este píxel), la máscara cuádruple es una máscara de 4 valores que codifica el objeto principal a eliminar, las regiones superpuestas, las regiones afectadas (objetos que caen, elementos desplazados) y el fondo a conservar.

En la práctica, cada píxel de la máscara obtiene uno de cuatro valores: 0 (objeto principal que se elimina), 63 (superposición entre las regiones primaria y afectada), 127 (región afectada por la interacción: cosas que se moverán o cambiarán como resultado de la eliminación) y 255 (fondo, se mantendrá como está). Esto le da al modelo un mapa semántico estructurado de lo que sucede en la escena, no solo de dónde está el objeto.

Canalización de inferencia de dos pasos

VOID utiliza dos puntos de control de transformadores, entrenados de forma secuencial. Puede ejecutar la inferencia solo con el Paso 1 o encadenar ambos pases para lograr una mayor coherencia temporal.

El paso 1 (void_pass1.safetensors) es el modelo base en pintura y es suficiente para la mayoría de los videos. El paso 2 tiene un propósito específico: corregir un modo de falla conocido. Si el modelo detecta transformación de objetos (un modo de falla conocido de modelos de difusión de video más pequeños), un segundo paso opcional vuelve a ejecutar la inferencia utilizando ruido deformado por flujo derivado del primer paso, estabilizando la forma del objeto a lo largo de las trayectorias recién sintetizadas.

Vale la pena entender la distinción: el paso 2 no es sólo para clips más largos, es específicamente una solución de estabilidad de forma. Cuando el modelo de difusión produce objetos que se deforman o deforman gradualmente a lo largo de los cuadros (un artefacto bien documentado en la difusión de video), el Paso 2 utiliza el flujo óptico para deformar las latentes del Paso 1 y los alimenta como inicialización a una segunda ejecución de difusión, anclando la forma de los objetos sintetizados cuadro a cuadro.

Cómo se generaron los datos de entrenamiento

Aquí es donde las cosas se ponen realmente interesantes. Entrenar un modelo para comprender las interacciones físicas requiere videos emparejados: la misma escena, con y sin el objeto, donde la física se desarrolla correctamente en ambos. No existen datos emparejados del mundo real a esta escala. Entonces el equipo lo construyó sintéticamente.

La capacitación utilizó videos contrafactuales emparejados generados a partir de dos fuentes: HUMOTO (interacciones entre humanos y objetos renderizadas en Blender con simulación física) y Kubric (interacciones solo de objetos utilizando Google Scanned Objects).

HUMOTO utiliza datos de captura de movimiento de las interacciones entre humanos y objetos. La mecánica clave es una re-simulación de Blender: la escena se configura con un humano y objetos, se renderiza una vez con el humano presente, luego el humano se elimina de la simulación y la física se vuelve a ejecutar desde ese punto. El resultado es un contrafactual físicamente correcto: los objetos que estaban siendo sostenidos o apoyados ahora caen exactamente como deberían. Kubric, desarrollado por Google Research, aplica la misma idea a las colisiones objeto-objeto. Juntos, producen un conjunto de datos de videos emparejados donde la física es demostrablemente correcta, no aproximada por un anotador humano.

Conclusiones clave

VOID va más allá del relleno de píxeles. A diferencia de las herramientas de pintura de video existentes que solo corrigen artefactos visuales como sombras y reflejos, VOID comprende la causalidad física: si elimina a una persona que sostiene un objeto, el objeto cae naturalmente en el video de salida. La máscara cuádruple es la innovación central. En lugar de una simple máscara binaria para eliminar/mantener, VOID utiliza una máscara cuádruple de 4 valores (valores 0, 63, 127, 255) que codifica no solo qué eliminar, sino también qué regiones circundantes de la escena se verán físicamente afectadas, lo que le da al modelo de difusión una comprensión estructurada de la escena con la que trabajar. La inferencia de dos pasos resuelve un modo de falla real. El paso 1 maneja la mayoría de los videos; El paso 2 existe específicamente para corregir artefactos de transformación de objetos (una debilidad conocida de los modelos de difusión de video) mediante el uso de latentes deformadas por flujo óptico del paso 1 como inicialización para una segunda ejecución de difusión. Los datos sintéticos pareados hicieron posible el entrenamiento. Dado que los datos de video contrafactuales emparejados del mundo real no existen a escala, el equipo de investigación los construyó utilizando la re-simulación de física de Blender (HUMOTO) y el marco Kubric de Google, generando pares de video de verdad sobre el terreno antes/después donde la física es demostrablemente correcta.

Consulte el papel, el peso del modelo y el repositorio. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.