Investigadores de CMU presentan Diffusion-TTA: elevando modelos de IA discriminativos con retroalimentación generativa para una adaptación incomparable en el tiempo de prueba

Los modelos de difusión se utilizan para generar muestras de alta calidad a partir de distribuciones de datos complejas. Los modelos de difusión discriminativa tienen como objetivo aprovechar los principios de los modelos de difusión para tareas como clasificación o regresión, donde el objetivo es predecir etiquetas o resultados para unos datos de entrada determinados. Al aprovechar los principios de los modelos de difusión, los modelos de difusión discriminativos ofrecen ventajas como un mejor manejo de la incertidumbre, robustez al ruido y el potencial de capturar dependencias complejas dentro de los datos.

Los modelos generativos pueden identificar anomalías o valores atípicos cuantificando la desviación de un nuevo punto de datos de la distribución de datos aprendida. Pueden distinguir entre instancias de datos normales y anormales, lo que ayuda en las tareas de detección de anomalías. Tradicionalmente, estos modelos generativos y discriminativos se consideran alternativas competitivas. Los investigadores de la Universidad Carnegie Mellon combinan estos dos modelos durante la etapa de inferencia de una manera que aprovecha los beneficios del razonamiento iterativo de la inversión generativa y la capacidad de ajuste de los modelos discriminativos.

El equipo creó un modelo de adaptación del tiempo de prueba (TTA) basado en difusión que adapta métodos de clasificadores de imágenes, segmentadores y predictores de profundidad a imágenes individuales sin etiquetar utilizando sus resultados para modular el condicionamiento de un modelo de difusión de imágenes y maximizar las difusiones de imágenes. Su modelo recuerda a una arquitectura codificador-decodificador. Un modelo discriminativo previamente entrenado codifica la imagen en una hipótesis, como una etiqueta de categoría de objeto, un mapa de segmentación o un mapa de profundidad. Esto se utiliza como condicionamiento a un modelo generativo previamente entrenado para generar la imagen.

Diffusion-TTA adapta eficazmente los clasificadores de imágenes para ejemplos dentro y fuera de la distribución en puntos de referencia establecidos, incluido ImageNet y sus variantes. Afinan el modelo utilizando la pérdida de reconstrucción de la imagen. La adaptación se lleva a cabo para cada instancia en el conjunto de pruebas propagando hacia atrás los gradientes de probabilidad de difusión a los pesos del modelo discriminativo. Muestran que su modelo supera a los métodos TTA de última generación anteriores y es eficaz en múltiples variantes de modelos de difusión discriminativa y generativa.

Los investigadores también presentan un análisis ablativo de varias opciones de diseño y estudian cómo Diffusion-TTA varía con hiperparámetros como los pasos de tiempo de difusión, el número de muestras por paso de tiempo y el tamaño del lote. También aprenden el efecto de adaptar diferentes parámetros del modelo.

Los investigadores dicen que Diffusion-TTA supera consistentemente al clasificador de difusión. Conjeturan que el modelo discriminativo no se ajusta demasiado a la pérdida generativa debido a la inicialización de peso del modelo discriminativo (preentrenado), lo que le impide converger a esta solución trivial.

En conclusión, los modelos generativos se han utilizado previamente para la adaptación en el tiempo de prueba de clasificadores y segmentos de imágenes; Al coentrenar el modelo Diffusion-TTA bajo una pérdida de tarea discriminativa conjunta y una pérdida de reconstrucción de imagen autosupervisada, los usuarios pueden obtener resultados eficientes.


Revisar la Papel y Proyecto. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 33k+ ML, 41k+ comunidad de Facebook, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.


Arshad es pasante en MarktechPost. Actualmente cursa su carrera internacional. Maestría en Física del Instituto Indio de Tecnología Kharagpur. Comprender las cosas hasta el nivel fundamental conduce a nuevos descubrimientos que conducen al avance de la tecnología. Le apasiona comprender la naturaleza fundamentalmente con la ayuda de herramientas como modelos matemáticos, modelos de aprendizaje automático e inteligencia artificial.