Este artículo de IA de Alibaba presenta Lumos-1: un generador de video autorregresivo unificado que aprovecha la cuerda MM y AR-DF para un modelado espacio-temporal eficiente

La generación de videos autorregresivos es un dominio de investigación en rápida evolución. Se centra en la síntesis de videos marco por marco utilizando patrones aprendidos de arreglos espaciales y dinámica temporal. A diferencia de los métodos tradicionales de creación de video, que pueden confiar en marcos preconstruidos o transiciones artesanales, los modelos autorregresivos tienen como objetivo generar contenido dinámicamente basado en tokens anteriores. Este enfoque es similar a cómo los modelos de idiomas grandes predicen la siguiente palabra. Ofrece un potencial para unificar la generación de video, imagen y texto en un marco compartido mediante el uso del poder estructural de las arquitecturas basadas en transformadores.

Un problema importante en este espacio es cómo capturar y modelar con precisión las dependencias espaciales intrínsecas en los videos. Los videos contienen estructuras ricas en el tiempo y el espacio. Codificando esta complejidad para que los modelos puedan predecir los marcos futuros coherentes sigan siendo un desafío. Cuando estas dependencias no se modelan bien, conduce a la continuidad del marco roto o la generación de contenido poco realista. Las técnicas de entrenamiento tradicionales como el enmascaramiento aleatorio también luchan. A menudo no proporcionan señales de aprendizaje equilibradas en los cuadros. Cuando la información espacial de los marcos adyacentes se filtra, la predicción se vuelve demasiado fácil.

Varios métodos intentan abordar este desafío adaptando la tubería de generación autorregresiva. Sin embargo, a menudo se desvían del estándar modelo de lenguaje grande estructuras. Algunos usan codificadores de texto pre-entrenados externos, lo que hace que los modelos sean más complejos y menos coherentes. Otros aportan una latencia significativa durante la generación con una decodificación ineficiente. Los modelos autorregresivos como Phenaki y EMU3 intentan admitir la generación de extremo a extremo. A pesar de esto, todavía luchan con la consistencia del rendimiento y los altos costos de capacitación. Las técnicas como el orden de escaneo de ráster o la atención de la secuencia global tampoco escala bien a los datos de video de alta dimensión.

El equipo de investigación de la Academia Damo de Alibaba Group, Hupan Lab y Zhejiang University introdujo Lumos-1. Es un modelo unificado para la generación de videos autorregresivos que se mantiene fiel a la arquitectura del modelo de lenguaje grande. A diferencia de las herramientas anteriores, Lumos-1 elimina la necesidad de codificadores externos y cambia muy poco en el diseño original de LLM. El modelo utiliza la cuerda MM, o incrustaciones de posición rotativa multimodal, para abordar el desafío de modelar la estructura tridimensional de Video. El modelo también utiliza un enfoque de dependencia del token. Esto preserva la bidireccionalidad intra-marco y la causalidad temporal entre marco, lo que se alinea más naturalmente con la forma en que se comportan los datos de video.

En MM-Rope, los investigadores amplían los métodos de cuerda existentes para equilibrar el espectro de frecuencia para las dimensiones espaciales y temporales. La cuerda 3D tradicional confunde el enfoque de frecuencia, causando pérdida de detalle o una codificación posicional ambigua. La cuerda MM reestructura las asignaciones para que la altura, la altura y el ancho reciban una representación equilibrada. Para abordar el desequilibrio de pérdida en el entrenamiento en términos de cuadro, LUMOS-1 introduce AR-DF o forzamiento de difusión discreta autorregresiva. Utiliza el enmascaramiento de tubo temporal durante el entrenamiento, por lo que el modelo no depende demasiado de la información espacial desenmascarada. Esto garantiza incluso el aprendizaje en la secuencia de video. La estrategia de inferencia refleja el entrenamiento, permitiendo la generación de marcos de alta calidad sin degradación.

Lumos-1 fue entrenado desde cero en 60 millones de imágenes y 10 millones de videos, utilizando solo 48 GPU. Esto se considera eficiente en la memoria dada la escala de entrenamiento. El modelo logró resultados comparables a los modelos superiores en el campo. Coincidió con los resultados de EMU3 en los puntos de referencia de Gineval. Se desempeñó de manera equivalente a Cosmos-Video2World en la prueba VBench-I2V. También rivalizó con las salidas de Opensoraplan en el punto de referencia VBench-T2V. Estas comparaciones muestran que el entrenamiento ligero de Lumos-1 no compromete la competitividad. El modelo admite texto a video, imagen a video y generación de texto a imagen. Esto demuestra una fuerte generalización entre modalidades.

En general, esta investigación no solo identifica y aborda los desafíos centrales en el modelado espacio-temporal para la generación de videos, sino que también muestra cómo Lumos-1 establece un nuevo estándar para unificar la eficiencia y la efectividad en los marcos autorregresivos. Al combinar con éxito arquitecturas avanzadas con capacitación innovadora, Lumos-1 allana el camino para la próxima generación de modelos de generación de videos escalables y de alta calidad y abre nuevas vías para futuras investigaciones multimodales.


Mira el Papel y Github. Todo el crédito por esta investigación va a los investigadores de este proyecto.


Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.