Los avances en los modelos generativos de texto a imagen (T2I) han sido espectaculares. Recientemente, los sistemas de texto a video (T2V) han logrado avances significativos, permitiendo la generación automática de videos basados en descripciones textuales. Un desafío principal en la síntesis de video es la gran cantidad de memoria y datos de entrenamiento necesarios. Se han propuesto métodos basados en el modelo de difusión estable (SD) previamente entrenado para abordar los problemas de eficiencia en la síntesis de texto a video (T2V).
Estos enfoques abordan el problema desde varias perspectivas, incluido el ajuste y el aprendizaje de tiro cero. Sin embargo, las indicaciones de texto deben proporcionar un mejor control sobre la disposición espacial y las trayectorias de los objetos en el vídeo generado. El trabajo existente ha abordado este problema proporcionando señales de control de bajo nivel, por ejemplo, utilizando mapas de bordes de Canny o esqueletos rastreados para guiar los objetos en el vídeo utilizando ControlNet Zhang y Agrawala. Estos métodos logran una buena controlabilidad pero requieren un esfuerzo considerable para producir la señal de control.
Captar el movimiento deseado de un animal o de un objeto caro sería bastante difícil, mientras que dibujar el movimiento deseado cuadro por cuadro sería tedioso. Para abordar las necesidades de los usuarios ocasionales, los investigadores de NVIDIA presentan una interfaz de alto nivel para controlar las trayectorias de los objetos en videos sintetizados. Los usuarios deben proporcionar cuadros delimitadores (bboxes) que especifiquen la posición deseada de un objeto en varios puntos del vídeo, junto con las indicaciones de texto que describen el objeto en los momentos correspondientes.
Su estrategia implica editar mapas de atención espacial y temporal para un objeto específico durante los pasos iniciales de difusión de eliminación de ruido para concentrar la activación en la ubicación deseada del objeto. Su enfoque de edición en tiempo de inferencia logra esto sin interrumpir la asociación texto-imagen aprendida en el modelo previamente entrenado y requiere modificaciones mínimas del código.
Su enfoque permite a los usuarios posicionar el sujeto mediante fotogramas clave en su cuadro delimitador. El tamaño del bbox se puede controlar de manera similar, produciendo así efectos de perspectiva. Finalmente, los usuarios también pueden crear fotogramas clave del mensaje de texto para influir en el comportamiento del sujeto en el vídeo sintetizado.
Al animar cuadros delimitadores y mensajes a través de fotogramas clave, los usuarios pueden modificar la trayectoria y el comportamiento básico del sujeto a lo largo del tiempo. Esto facilita la integración perfecta de los temas resultantes en un entorno específico, proporcionando una herramienta de narración en vídeo accesible para usuarios ocasionales.
Su enfoque no exige ningún ajuste del modelo, capacitación u optimización en línea, lo que garantiza eficiencia computacional y una excelente experiencia de usuario. Por último, su método produce resultados naturales, incorporando automáticamente efectos deseables como perspectiva, movimiento preciso de los objetos e interacciones entre los objetos y su entorno.
Sin embargo, su método hereda casos de fallas comunes del modelo de difusión subyacente, incluidos desafíos con objetos deformados y dificultades para generar múltiples objetos con atributos precisos como el color.
Revisar la Papel y Proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo. Unirse nuestro SubReddit de más de 35.000 ml, 41k+ comunidad de Facebook, Canal de discordiay LinkedIn Grarriba.
Si te gusta nuestro trabajo, te encantará nuestra newsletter.
Arshad es pasante en MarktechPost. Actualmente cursa su carrera internacional. Maestría en Física del Instituto Indio de Tecnología Kharagpur. Comprender las cosas hasta el nivel fundamental conduce a nuevos descubrimientos que conducen al avance de la tecnología. Le apasiona comprender la naturaleza fundamentalmente con la ayuda de herramientas como modelos matemáticos, modelos de aprendizaje automático e inteligencia artificial.