En los últimos años, los modelos de difusión (DM) han logrado avances significativos en el ámbito de la síntesis de imágenes. Esto ha llevado a un mayor enfoque en la generación de imágenes fotorrealistas a partir de descripciones de texto (T2I). Sobre la base de los logros de los modelos T2I, ha habido un creciente interés entre los investigadores en extender estas técnicas a la síntesis de vídeos controlados por entradas de texto (T2V). Esta expansión está impulsada por las aplicaciones previstas de los modelos T2V en ámbitos como el cine, los videojuegos y la creación artística.
Lograr el equilibrio adecuado entre la calidad del video, el costo de capacitación y la composicionalidad del modelo sigue siendo una tarea compleja, que requiere consideraciones cuidadosas en la arquitectura del modelo, las estrategias de capacitación y la recopilación de conjuntos de datos de texto y video de alta calidad.
En respuesta a estos desafíos, se ha introducido un nuevo marco integrado de generación de vídeo llamado LaVie. Este marco, que cuenta con un total de 3 mil millones de parámetros, opera utilizando modelos de difusión latente de video en cascada. LaVie sirve como modelo fundamental de texto a video construido sobre un modelo T2I previamente entrenado (específicamente, Stable Diffusion, presentado por Rombach et al., 2022). Su objetivo principal es sintetizar videos visualmente realistas y temporalmente coherentes conservando al mismo tiempo las capacidades de generación creativa del modelo T2I previamente entrenado.
La Figura 1 anterior muestra muestras de texto a video y la Figura 2 muestra resultados de generación de videos diversos por parte de Lavie.
LaVie incorpora dos ideas clave en su diseño. En primer lugar, utiliza una simple autoatención temporal junto con RoPE para capturar de forma eficaz las correlaciones temporales inherentes en los datos de vídeo. Las modificaciones arquitectónicas complejas proporcionan sólo mejoras marginales en los resultados generados. En segundo lugar, LaVie emplea un ajuste fino conjunto de imagen y video, que es esencial para producir resultados creativos y de alta calidad. Intentar realizar ajustes directamente en conjuntos de datos de vídeo puede comprometer la capacidad del modelo para mezclar conceptos y provocar un olvido catastrófico. El ajuste conjunto de imagen y vídeo facilita la transferencia de conocimientos a gran escala de imágenes a vídeos, abarcando escenas, estilos y personajes.
Además, el conjunto de datos de texto y video disponible públicamente, WebVid10M, resulta inadecuado para respaldar la tarea T2V debido a su baja resolución y su enfoque en videos centrados en marcas de agua. En respuesta, LaVie se beneficia de un conjunto de datos de texto y vídeo recientemente introducido llamado Vimeo25M, que comprende 25 millones de vídeos de alta resolución (> 720p) acompañados de descripciones de texto.
Los experimentos demuestran que el entrenamiento en Vimeo25M mejora significativamente el rendimiento de LaVie, permitiéndole generar resultados superiores en términos de calidad, diversidad y atractivo estético. Los investigadores visualizan a LaVie como un paso inicial hacia la generación de T2V de alta calidad. Las futuras direcciones de investigación implican ampliar las capacidades de LaVie para sintetizar vídeos más largos con transiciones intrincadas y calidad de nivel cinematográfico basándose en descripciones de guiones.
Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 31k+ ML, Comunidad de Facebook de más de 40.000 personas, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.
Si te gusta nuestro trabajo, te encantará nuestra newsletter.
Janhavi Lande, se graduó en Ingeniería Física del IIT Guwahati, promoción de 2023. Es una futura científica de datos y ha estado trabajando en el mundo de la investigación ml/ai durante los últimos dos años. Lo que más le fascina es este mundo en constante cambio y su constante exigencia de que los humanos se mantengan al día. En su pasatiempo le gusta viajar, leer y escribir poemas.