Meta AI lanzó el Modelo de lenguaje de percepción (PLM): un modelo de lenguaje de visión abierto y reproducible para abordar tareas desafiantes de reconocimiento visual

A pesar de los rápidos avances en el modelado del idioma de la visión, gran parte del progreso en este campo ha sido moldeado por modelos capacitados en conjuntos de datos patentados, a menudo dependiendo de la destilación de los sistemas de código cerrado. Esta confianza crea barreras para la transparencia científica y la reproducibilidad, particularmente para las tareas que involucran imágenes de grano fino y comprensión de video. El rendimiento de referencia puede reflejar los datos de capacitación y las capacidades del modelo de caja negra más que las mejoras arquitectónicas o metodológicas, lo que dificulta la evaluación del progreso de la investigación verdadera.

Para abordar estas limitaciones, Meta AI ha introducido el Modelo de lenguaje de percepción (PLM), un marco completamente abierto y reproducible para el modelado en idioma de visión. PLM está diseñado para admitir entradas de imagen y video y está capacitado sin el uso de salidas de modelo patentadas. En cambio, se basa en datos sintéticos a gran escala y conjuntos de datos marcados con humanos recientemente recopilados, lo que permite una evaluación detallada del comportamiento del modelo y la dinámica de entrenamiento en condiciones transparentes.

El marco PLM integra un codificador de visión (codificador de percepción) con decodificadores de idiomas de Llama 3 de diferentes tamaños: parámetros 1b, 3b y 8b. Emplea una cartera de capacitación en varias etapas: calentamiento inicial con imágenes sintéticas de baja resolución, entradas medias a gran escala en diversos conjuntos de datos sintéticos y ajuste fino supervisado utilizando datos de alta resolución con anotaciones precisas. Esta tubería enfatiza la estabilidad y la escalabilidad del entrenamiento al tiempo que mantiene el control sobre la procedencia y el contenido de los datos.

Una contribución clave del trabajo es el lanzamiento de dos conjuntos de datos de video a gran escala y alta calidad que abordan los espacios existentes en la comprensión temporal y espacial. El PLM – FGQA El conjunto de datos comprende 2,4 millones de parejas de respuesta a las preguntas que capturan los detalles de grano fino de las acciones humanas, como la manipulación de objetos, la dirección del movimiento y las relaciones espaciales, achesados ​​de diversos dominios de video. Complementando esto es PLM – STCun conjunto de datos de 476,000 subtítulos espacio-temporales vinculados a máscaras de segmentación que rastrean los sujetos a lo largo del tiempo, lo que permite que los modelos razonen sobre “qué”, “dónde” y “cuándo” en escenas de video complejas.

Técnicamente, PLM emplea una arquitectura modular que admite el mosaico de imágenes de alta resolución (hasta 36 mosaicos) y la entrada de video multiframe (hasta 32 cuadros). Un proyector MLP de 2 capas conecta el codificador visual con el LLM, y los datos sintéticos y marcados con humanos están estructurados para admitir una amplia gama de tareas, incluidos los subtítulos, la respuesta de preguntas visuales y el denso razonamiento basado en la región. El motor de datos sintéticos, construido completamente utilizando modelos de código abierto, genera ~ 64.7 millones de muestras en imágenes, cuadros, documentos y videos naturales, lo que garantiza la diversidad al tiempo que evita la dependencia de fuentes propietarias.

Meta Ai también presenta Plm – videobenchun nuevo punto de referencia diseñado para evaluar aspectos de la comprensión de video no capturado por los puntos de referencia existentes. Incluye tareas como el reconocimiento de actividad de grano fino (FGQA), el QA de video de glasses inteligentes (SGQA), el subtítulos densos basados ​​en la región (RDCAP) y la localización espacio-temporal (RTLOC). Estas tareas requieren que los modelos participen en un razonamiento temporalmente fundamentado y espacialmente explícito.

Las evaluaciones empíricas muestran que los modelos PLM, particularmente en la escala de parámetros 8B, se desempeñan de manera competitiva en más de 40 puntos de referencia de imagen y video. En el subtítulos de video, PLM logra ganancias de +39.8 sidra en promedio sobre líneas de base abiertas. En PLM-VideoBench, la variante 8B cierra la brecha con el rendimiento humano en tareas estructuradas como FGQA y muestra resultados mejorados en la localización espacio-temporal y el subtítulos densos. En particular, todos los resultados se obtienen sin destilación de los modelos cerrados, lo que subraya la viabilidad del desarrollo abierto y transparente de VLM.

En resumen, PLM ofrece un marco metodológicamente riguroso y completamente abierto para capacitar y evaluar modelos en idioma de visión. Su lanzamiento incluye no solo modelos y código, sino también el conjunto de datos curado más grande para la comprensión de video de grano fino y un conjunto de referencia que se dirige a capacidades previamente subexploradas. PLM está posicionado para servir como base para la investigación reproducible en IA multimodal y un recurso para trabajos futuros sobre razonamiento visual detallado en entornos abiertos.


Aquí está el Papel, Modelo y Código. Además, no olvides seguirnos Gorjeo y únete a nuestro Canal de telegrama y LinkedIn GRsalpicar. No olvides unirte a nuestro 90k+ ml de subreddit.

🔥 [Register Now] Conferencia virtual de Minicon sobre AI agente: registro gratuito + Certificado de asistencia + Evento corto de 4 horas (21 de mayo, 9 am- 1 pm PST) + Hands on Workshop


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.