Investigadores del MIT, Google DeepMind y Oxford revelan por qué los modelos de visión y lenguaje no comprenden la negación y proponen una solución innovadora

Los modelos de visión y lenguaje (VLM) desempeñan un papel crucial en tareas multimodales como la recuperación de imágenes, los subtítulos y el diagnóstico médico al alinear datos visuales y lingüísticos. Sin embargo, comprender la negación en estos modelos sigue siendo uno de los principales desafíos. La negación es fundamental para aplicaciones matizadas, como distinguir “una habitación sin ventanas” de “una habitación con ventanas”. A pesar de sus avances, los VLM actuales no logran interpretar la negación de manera confiable, lo que limita severamente su efectividad en dominios de alto riesgo como el monitoreo de la seguridad y la atención médica. Abordar este desafío es esencial para ampliar su aplicabilidad en escenarios del mundo real.

Los VLM actuales, como CLIP, utilizan espacios de incrustación compartidos para alinear representaciones visuales y textuales. Aunque estos modelos destacan en tareas como la recuperación multimodal y los subtítulos de imágenes, su rendimiento cae drásticamente cuando se trata de declaraciones negadas. Esta limitación surge debido a los sesgos de los datos previos al entrenamiento porque los conjuntos de datos de entrenamiento contienen principalmente ejemplos afirmativos, lo que genera un sesgo de afirmación, donde los modelos tratan las declaraciones afirmativas y negadas como equivalentes. Los puntos de referencia existentes, como CREPE y CC-Neg, se basan en ejemplos simplistas con plantillas que no representan la riqueza y profundidad de la negación en el lenguaje natural. Los VLM tienden a colapsar las incrustaciones de subtítulos negativos y afirmativos, por lo que es extremadamente difícil separar las diferencias detalladas entre los conceptos. Esto plantea un problema en el uso de VLM para aplicaciones precisas de comprensión del lenguaje, por ejemplo, consulta de una base de datos de imágenes médicas con criterios complejos de inclusión y exclusión.

Para abordar estas limitaciones, investigadores del MIT, Google DeepMind y la Universidad de Oxford propusieron el marco NegBench para la evaluación y mejora de la comprensión de la negación sobre los VLM. El marco evalúa dos tareas fundamentales: Recuperación con Negación (Retrieval-Neg), que examina la capacidad del modelo para recuperar imágenes de acuerdo con especificaciones tanto afirmativas como negadas, como “una playa sin gente”, y Preguntas de opción múltiple con negación (MCQ- Neg), que evalúa la comprensión matizada al requerir que los modelos seleccionen subtítulos apropiados a partir de ligeras variaciones. Utiliza enormes conjuntos de datos sintéticos, como CC12M-NegCap y CC12M-NegMCQ, aumentados con millones de subtítulos que contienen una amplia gama de escenarios de negación. Esto expondrá a los VLM a aspectos negativos y subtítulos parafraseados algo desafiantes, lo que mejorará el entrenamiento y la evaluación de los modelos. También se adaptaron conjuntos de datos estándar, como COCO y MSR-VTT, incluidos subtítulos negados y paráfrasis, para ampliar aún más la diversidad lingüística y probar la solidez. Al incorporar ejemplos de negación variados y complejos, NegBench supera eficazmente las limitaciones existentes, mejorando significativamente el rendimiento y la generalización del modelo.

NegBench aprovecha conjuntos de datos reales y sintéticos para probar la comprensión de la negación. Se adaptaron conjuntos de datos como COCO, VOC2007 y CheXpert para incluir escenarios de negación, como “Esta imagen incluye árboles pero no edificios”. Para las preguntas frecuentes, se utilizaron plantillas como “Esta imagen incluye A pero no B” junto con variaciones parafraseadas para mayor diversidad. NegBench se complementa aún más con el conjunto de datos HardNeg-Syn, donde las imágenes se sintetizan para presentar pares que difieren entre sí basándose únicamente en la aparición o ausencia de ciertos objetos, lo que constituye casos difíciles para la comprensión de la negación. El ajuste del modelo se basó en dos objetivos de formación. Por un lado, la pérdida de contraste facilitó la alineación entre los pares imagen-título, mejorando el rendimiento en la recuperación. Por otro lado, el uso de la pérdida de opción múltiple ayudó a realizar juicios de negación detallados al preferir los títulos correctos en el contexto del MCQ.

Los modelos ajustados mostraron mejoras considerables en las tareas de recuperación y comprensión utilizando conjuntos de datos enriquecidos con negación. Para la recuperación, la recuperación del modelo aumenta en un 10% para consultas negadas, donde el rendimiento está casi a la par con las tareas de recuperación estándar. En las tareas de preguntas de opción múltiple, se informaron mejoras en la precisión de hasta un 40 %, lo que muestra una mejor capacidad para diferenciar entre los sutiles subtítulos afirmativos y negados. Los avances fueron uniformes en una variedad de conjuntos de datos, incluidos COCO y MSR-VTT, y en conjuntos de datos sintéticos como HardNeg-Syn, donde los modelos manejaron apropiadamente la negación y los desarrollos lingüísticos complejos. Esto sugiere que representar escenarios con diversos tipos de negación en el entrenamiento y las pruebas es eficaz para reducir el sesgo de afirmación y la generalización.

NegBench aborda una brecha crítica en los VLM al ser el primer trabajo que aborda su incapacidad para comprender la negación. Aporta mejoras significativas en las tareas de recuperación y comprensión al incorporar diversos ejemplos de negación en tr.AIning y evaluación. Estas mejoras abren caminos para sistemas de IA mucho más robustos que sean capaces de comprender el lenguaje con matices, con implicaciones importantes para dominios críticos como el diagnóstico médico y la recuperación de contenido semántico.


Verificar el Papel y Código. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de telegramas y LinkedIn Grarriba. No olvides unirte a nuestro SubReddit de más de 65.000 ml.

🚨 [Recommended Read] Nebius AI Studio se expande con modelos de visión, nuevos modelos de lenguaje, incorporaciones y LoRA (Promovido)


Aswin AK es pasante de consultoría en MarkTechPost. Está cursando su doble titulación en el Instituto Indio de Tecnología de Kharagpur. Le apasiona la ciencia de datos y el aprendizaje automático, y aporta una sólida formación académica y experiencia práctica en la resolución de desafíos interdisciplinarios de la vida real.