Los modelos de difusión latente son modelos generativos utilizados en el aprendizaje automático, particularmente en el modelado probabilístico. Estos modelos tienen como objetivo capturar la estructura subyacente o las variables latentes de un conjunto de datos, y a menudo se centran en generar muestras realistas o hacer predicciones. Estos describen la evolución de un sistema a lo largo del tiempo. Esto puede referirse a transformar un conjunto de variables aleatorias desde una distribución inicial a una distribución deseada a través de una serie de pasos o procesos de difusión.
Estos modelos se basan en métodos ODE-Solver. A pesar de reducir la cantidad de pasos de inferencia necesarios, todavía exigen una sobrecarga computacional significativa, especialmente cuando incorporan guía sin clasificador. Los métodos de destilación como el Guided-Distill son prometedores, pero deben mejorarse debido a sus intensos requisitos computacionales.
Para abordar estas cuestiones, ha surgido la necesidad de modelos de coherencia latente. Su enfoque implica un proceso de difusión inversa, tratándolo como un problema de ODE de témpano de probabilidad aumentada. Predicen de forma innovadora la solución en el espacio latente y evitan la necesidad de soluciones iterativas mediante solucionadores numéricos de EDO. Sólo se necesitan de 1 a 4 pasos de inferencia en la extraordinaria síntesis de imágenes de alta resolución.
Los investigadores de la Universidad de Tsinghua amplían el potencial del LCM aplicando la destilación LoRA a modelos de difusión estable, incluidos SD-V1.5, SSD-1B y SDXL. Han ampliado el alcance de LCM a modelos más grandes con un consumo de memoria significativamente menor al lograr una calidad de generación de imágenes superior. Para conjuntos de datos especializados como los de imágenes de anime, fotorrealistas o de fantasía, se necesitan pasos adicionales, como emplear la destilación de consistencia latente (LCD) para destilar un LDM previamente entrenado en un LCM o ajustar directamente un LCM usando LCF. Sin embargo, ¿se puede lograr una inferencia rápida y sin capacitación sobre conjuntos de datos personalizados?
El equipo presenta LCM-LoRA como un módulo de aceleración universal sin entrenamiento que se puede conectar directamente a varios modelos ajustados de Stable-Diffusion para responder a esto. Dentro del marco de LoRA, los parámetros LoRA resultantes se pueden integrar perfectamente en los parámetros del modelo original. El equipo ha demostrado la viabilidad de emplear LoRA para el proceso de destilación de modelos de consistencia latente (LCM). Los parámetros LCM-LoRA se pueden combinar directamente con otros parámetros LoRA y ajustar en conjuntos de datos de estilos particulares. Esto permitirá generar imágenes en estilos específicos con pasos mínimos de muestreo sin necesidad de capacitación adicional. Por tanto, representan un acelerador de aplicación universal para diversas tareas de generación de imágenes.
Este enfoque innovador reduce significativamente la necesidad de pasos iterativos, lo que permite la generación rápida de imágenes de alta fidelidad a partir de entradas de texto y establece un nuevo estándar para el rendimiento de última generación. LoRA reduce significativamente el volumen de parámetros que se van a modificar, mejorando así la eficiencia computacional y permitiendo el refinamiento del modelo con muchos menos datos.
Revisar la Papel y GitHub. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 33k+ ML, 41k+ comunidad de Facebook, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.
Si te gusta nuestro trabajo, te encantará nuestra newsletter.
Arshad es pasante en MarktechPost. Actualmente cursa su carrera internacional. Maestría en Física del Instituto Indio de Tecnología Kharagpur. Comprender las cosas hasta el nivel fundamental conduce a nuevos descubrimientos que conducen al avance de la tecnología. Le apasiona comprender la naturaleza fundamentalmente con la ayuda de herramientas como modelos matemáticos, modelos de aprendizaje automático e inteligencia artificial.