La IA generativa enfrenta un desafío crítico para equilibrar la autonomía y la capacidad de control. Si bien la autonomía ha avanzado significativamente a través de potentes modelos generativos, la capacidad de control se ha convertido en un punto focal para los investigadores de aprendizaje automático. El control basado en texto se ha vuelto particularmente importante ya que el lenguaje natural ofrece una interfaz intuitiva entre humanos y máquinas. Este enfoque ha permitido aplicaciones notables en la edición de imágenes, la síntesis de audio y la generación de videos. Los modelos generativos recientes de texto a datos, particularmente aquellos que emplean técnicas de difusión, han mostrado resultados impresionantes al utilizar ideas semánticas de extensos conjuntos de datos de pares de texto de datos. Sin embargo, surgen barreras significativas en situaciones de baja recursos en las que obtener suficientes datos parados de texto se vuelve prohibitivamente costoso o complicado debido a estructuras de datos complejas. Los dominios críticos como los datos moleculares, la captura de movimiento y las series de tiempo a menudo carecen de etiquetas de texto adecuadas, lo que restringe las capacidades de aprendizaje supervisadas e impide la implementación de modelos generativos avanzados. Estas limitaciones resultan previsiblemente en una mala calidad de generación, sobrecargado de modelos, sesgo y diversidad de salida limitada, revelando una brecha sustancial en la optimización de representaciones de texto para una mejor alineación en contextos de datos limitados.
El escenario de baja recursos ha provocado varios enfoques de mitigación, cada uno con limitaciones inherentes. Las técnicas de aumento de datos a menudo no pueden alinear con precisión los datos sintéticos con las descripciones de texto originales y el exceso de riesgo al tiempo que aumenta las demandas computacionales en modelos de difusión. El aprendizaje semi-supervisado lucha con las ambigüedades inherentes en los datos textuales, lo que hace que la interpretación correcta sea desafiante al procesar muestras no etiquetadas. Transferir el aprendizajeaunque es prometedor para conjuntos de datos limitados, con frecuencia sufre de olvido catastrófico, donde el modelo pierde el conocimiento previamente adquirido a medida que se adapta a las nuevas descripciones de texto. Estas deficiencias metodológicas destacan la necesidad de enfoques más sólidos diseñados específicamente para la generación de texto a datos en entornos de baja recursos.
En este documento, los investigadores de la investigación de Salesforce AI presente Text2data que introduce un marco basado en difusión que mejora la capacidad de control de texto a datos en escenarios de baja recursos a través de un enfoque de dos etapas. Primero, domina la distribución de datos utilizando datos no etiquetados a través de un modelo de difusión no supervisado, evitando la ambigüedad semántica común en los métodos semi-supervisados. En segundo lugar, implementa el ajuste fino controlable en los datos marcados con texto sin expandir el conjunto de datos de capacitación. En su lugar, Text2Data emplea un objetivo de aprendizaje basado en la optimización de restricciones que evita el olvido catastrófico al mantener los parámetros del modelo cerca de su estado de ajuste previo a fin. Este marco único utiliza efectivamente datos etiquetados y sin etiquetar para mantener la distribución de datos de grano fino mientras logran una controlabilidad superior. La validación teórica respalda la selección de restricciones de optimización y los límites de generalización, con experimentos integrales en tres modalidades que demuestran la calidad y control de la generación superior de Text2Data en comparación con los métodos de referencia.
Text2Data aborda la generación de datos controlables aprendiendo la distribución condicional Pθ (x | c) donde los datos limitados emparejados crean desafíos de optimización. El marco funciona en dos fases distintas como se ilustra en la figura a continuación. Inicialmente, utiliza datos no etiquetados más abundantes para aprender la distribución marginal Pθ (x), obteniendo parámetros óptimos θ̂ dentro del conjunto θ. Este enfoque explota la relación matemática entre las distribuciones marginales y condicionales, donde Pθ (x) se aproxima al valor esperado de Pθ (x | c) sobre la distribución del texto. Posteriormente, Text2Data Fine-ajusta estos parámetros utilizando los pares de texto de datos etiquetados disponibles al implementar la optimización de restricciones para mantener los parámetros actualizados θ̂ ‘dentro de la intersección de θ y θ’. Esta restricción garantiza que el modelo mantenga el conocimiento de la distribución general de datos al tiempo que obtiene la capacidad de control del texto, evitando efectivamente el olvido catastrófico que generalmente ocurre durante los procesos de ajuste fino.
Text2Data implementa su enfoque de dos fases utilizando primero todos los datos disponibles con tokens nulos como condiciones para aprender la distribución general de datos. Esto permite que el modelo optimice Pθ (x | ∅), lo que equivale a Pθ (x) ya que el token nulo es independiente de x. La segunda fase introduce un marco de optimización de restricciones que ajusta el modelo en los datos marcados con texto al tiempo que evita la deriva de los parámetros de la distribución previamente aprendida. Matemáticamente, esto se expresa como minimización de la probabilidad negativa de log de probabilidad condicional Pθ (x | c) sujeto a la restricción de que el rendimiento de la distribución marginal permanece cerca del valor óptimo ξ establecido durante la primera fase. Este enfoque basado en restricciones aborda directamente el olvido catastrófico al garantizar que los parámetros del modelo permanezcan dentro de un conjunto óptimo donde la representación general de datos y la capacidad de control específica del texto pueden coexistir, la resolución esencialmente un problema de optimización léxicográfica que equilibra estos objetivos competitivos.
Implementa la guía de difusión sin clasificadores transformando el objetivo teórico en funciones de pérdida práctica. El marco optimiza tres componentes clave: L1 (θ) para el aprendizaje general de distribución de datos, L’1 (θ) para la preservación de la distribución en datos etiquetados y L2 (θ) para la generación condicionada por texto. Estos se estiman empíricamente utilizando muestras de datos disponibles. El proceso de optimización lexicográfica, detallado en el Algoritmo 1, equilibra estos objetivos ajustando dinámicamente las actualizaciones de gradiente con un parámetro λ que hace cumplir las restricciones al tiempo que permite un aprendizaje efectivo. Este enfoque utiliza una regla de actualización sofisticada donde θ se modifica en función de una combinación ponderada de gradientes de ambos objetivos. La restricción puede relajarse durante el entrenamiento para mejorar la convergencia, reconociendo que los parámetros no necesitan ser un subconjunto exacto del espacio de parámetros original, pero debe permanecer proximal al conocimiento de la distribución de la distribución al tiempo que obtiene la capacidad de control.
Text2Data proporciona bases teóricas para su enfoque de optimización de restricciones a través de límites de generalización que validan la selección de parámetros. El marco establece que las variables aleatorias derivadas del proceso de difusión son sub-gaussianos, lo que permite la formulación de rigurosos límites de confianza. El teorema 0.2 ofrece tres garantías críticas: primero, el parámetro empírico establecido dentro del límite de confianza abarca completamente el verdadero conjunto óptimo; En segundo lugar, la solución empírica compite de manera efectiva con el óptimo teórico en el objetivo primario; y tercero, la solución empírica mantiene una adherencia razonable a la restricción teórica. La implementación práctica introduce un parámetro de relajación ρ que ajusta la rigidez de la restricción mientras lo mantiene dentro del intervalo de confianza matemáticamente justificado. Esta relajación reconoce las condiciones del mundo real donde es factible obtener numerosas muestras no etiquetadas, lo que hace que la confianza sea limitada, incluso cuando se maneja modelos con millones de parámetros. Los experimentos con generación de movimiento que involucran 45,000 muestras y 14 millones de parámetros confirman la viabilidad práctica del marco.
Text2Data demuestra una controlabilidad superior en múltiples dominios en comparación con los métodos de referencia. En la generación molecular, logra un error absoluto medio más bajo (MAE) para todas las propiedades en comparación con EDM-Finetune y EDM, particularmente sobresaliendo con propiedades como ϵlumo y CV. Para la generación de movimiento, Text2Data supera a MDM-Finetune y MDM en Métricas de precisión y de distancia multimodal. En la generación de series temporales, supera constantemente las diferencias y difuntos en todas las propiedades evaluadas. Más allá de la controlabilidad, Text2Data mantiene una calidad de generación excepcional, que muestra mejoras en la validez molecular, la estabilidad, la diversidad de generación de movimiento y la alineación de la distribución en las series de tiempo. Estos resultados validan la efectividad de Text2Data para mitigar el olvido catastrófico al tiempo que preservan la calidad de la generación.
Text2data Aborda efectivamente los desafíos de la generación de texto a datos en escenarios de baja recursos en múltiples modalidades. Al utilizar inicialmente los datos no etiquetados para comprender la distribución general de datos y luego implementar la optimización de restricciones durante el ajuste fino en los datos etiquetados, el marco equilibra con éxito la capacidad de control con la preservación de la distribución. Este enfoque evita el olvido catastrófico mientras se mantiene la calidad de la generación. Los resultados experimentales demuestran consistentemente la superioridad de Text2Data sobre los métodos de referencia tanto en la capacidad de control como en la calidad de la generación. Aunque se implementan con modelos de difusión, los principios de Text2Data se pueden adaptar fácilmente a otras arquitecturas generativas.
Verificar el Papel y Página de Github. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 80k+ ml.
Asjad es consultor interno en MarktechPost. Está persiguiendo B.Tech en Ingeniería Mecánica en el Instituto de Tecnología Indio, Kharagpur. Asjad es un entusiasta de aprendizaje automático y aprendizaje profundo que siempre está investigando las aplicaciones del aprendizaje automático en la atención médica.