Ejecutar una potente IA en su teléfono inteligente no es sólo un problema de hardware: es un problema de arquitectura de modelo. La mayoría de los codificadores de visión de última generación son enormes y, cuando los recortas para que quepan en un dispositivo de borde, pierden las capacidades que los hicieron útiles en primer lugar. Peor aún, los modelos especializados tienden a sobresalir en un tipo de tarea (clasificación de imágenes, por ejemplo, o segmentación de escenas), pero se desmoronan cuando les pides que hagan algo fuera de su carril.
Los equipos de investigación de IA de Meta ahora proponen un camino diferente. Presentaron el codificador de percepción universal eficiente (EUPE): un codificador de visión compacto que maneja diversas tareas de visión simultáneamente sin necesidad de ser grande.
El problema central: especialistas versus generalistas
Para comprender por qué es importante EUPE, es útil comprender cómo funcionan los codificadores de visión y por qué la especialización es un problema.
Un codificador de visión es la parte de un modelo de visión por computadora que convierte los píxeles de una imagen sin procesar en una representación compacta (un conjunto de vectores de características) que pueden utilizar tareas posteriores (como clasificación, segmentación o respuesta a preguntas sobre una imagen). Piense en ello como los "ojos" de un canal de IA.
Los codificadores de visión básicos modernos están capacitados con objetivos específicos, lo que les da una ventaja en dominios particulares. Por ejemplo:
CLIP y SigLIP 2 están entrenados en pares texto-imagen. Son buenos en la comprensión de imágenes y el modelado de visión y lenguaje, pero su desempeño en tareas de predicción densas (que requieren características espacialmente precisas a nivel de píxeles) a menudo cae por debajo de las expectativas. DINOv2 y su sucesor DINOv3 son modelos autosupervisados que aprenden descriptores estructurales y geométricos excepcionales, lo que los hace fuertes en tareas de predicción densas como la segmentación semántica y la estimación de profundidad. Pero carecen de capacidades satisfactorias de visión y lenguaje. SAM (Segment Anything Model) logra una impresionante segmentación de tiro cero mediante el entrenamiento en conjuntos de datos de segmentación masivos, pero nuevamente se queda corto en las tareas de visión y lenguaje.
Para un dispositivo de borde (un teléfono inteligente o un auricular AR) que necesita manejar todos estos tipos de tareas simultáneamente, la solución típica es implementar varios codificadores a la vez. Esto rápidamente se vuelve prohibitivo para el cálculo. La alternativa es aceptar que un único codificador tendrá un rendimiento inferior en varios dominios.
Intentos anteriores: por qué los métodos aglomerativos se quedaron cortos en cuanto a pilares eficientes
Los investigadores han intentado combinar las fortalezas de múltiples codificadores especializados a través de una familia de métodos llamados destilación aglomerativa de múltiples maestros. La idea básica: entrenar a un codificador de un solo estudiante para que imite simultáneamente varios modelos de profesores, cada uno de los cuales es un experto en el dominio.
AM-RADIO y su sucesor RADIOv2.5 son quizás los ejemplos más conocidos de este enfoque. Demostraron que la destilación aglomerativa puede funcionar bien para codificadores grandes: modelos con más de 300 millones de parámetros. Pero la investigación de la EUPE demuestra una clara limitación: cuando se aplica la misma receta a estructuras centrales eficientes, los resultados se degradan sustancialmente. RADIOv2.5-B, la variante de escala ViT-B, tiene brechas significativas en comparación con los expertos en el dominio en tareas de predicción densa y VLM.
Otro método aglomerativo, DUNE, fusiona profesores de visión 2D y percepción 3D a través de una co-destilación heterogénea, pero de manera similar lucha en la escala central eficiente.
La causa fundamental, sostiene el equipo de investigación, es la capacidad. Los codificadores eficientes simplemente no tienen suficiente capacidad de representación para absorber directamente diversas representaciones de características de múltiples profesores especialistas y unificarlas en una representación universal. Intentar hacerlo en un solo paso produce un modelo mediocre en todos los ámbitos.
La respuesta de EUPE: primero ampliar y luego reducir
La idea clave detrás de EUPE es un principio denominado "primero ampliar y luego reducir".
En lugar de extraer directamente de varios profesores expertos en un dominio a un pequeño estudiante, EUPE introduce un modelo intermedio: un gran profesor sustituto con capacidad suficiente para unificar el conocimiento de todos los expertos en el dominio. Este maestro sustituto luego transfiere su conocimiento universal unificado al estudiante eficiente a través de la destilación.
El proceso completo tiene tres etapas:
Etapa 1: Destilación de varios docentes en el modelo proxy. Varios codificadores básicos de gran tamaño actúan como profesores simultáneamente y procesan imágenes sin etiquetas en sus resoluciones nativas. Cada profesor genera una ficha de clase y un conjunto de fichas de parche. El modelo proxy, un modelo de 1.900 millones de parámetros entrenado con 4 tokens de registro, está entrenado para imitar a todos los profesores a la vez. Los profesores seleccionados son:
PEcore-G (1,9 mil millones de parámetros), seleccionado como experto en el dominio para la clasificación y recuperación de imágenes de disparo cero PElang-G (1,7 mil millones de parámetros), que el equipo de investigación encontró que es crucial para el modelado de visión y lenguaje, particularmente el rendimiento de OCR DINOv3-H+ (840 millones de parámetros), seleccionado como experto en el dominio para predicción densa
Para estabilizar la capacitación, los resultados de los docentes se normalizan restando la media por coordenada y dividiéndola por la desviación estándar, se calcula una vez en 500 iteraciones antes de que comience la capacitación y se mantiene fija a partir de entonces. Esto es deliberadamente más simple que la compleja normalización PHI-S utilizada en RADIOv2.5 y evita la sobrecarga de memoria entre GPU al calcular las estadísticas de normalización sobre la marcha.
Etapa 2: destilación de resolución fija en el estudiante eficiente. Ahora que el modelo proxy actúa como un único maestro universal, el codificador eficiente objetivo se entrena con una resolución fija de 256 × 256. Esta resolución fija hace que el entrenamiento sea computacionalmente eficiente, lo que permite un programa de aprendizaje más largo: 390 000 iteraciones con un tamaño de lote de 8192, un programa de tasa de aprendizaje de coseno, una tasa de aprendizaje base de 2e-5 y una caída de peso de 1e-4. Se aplica el aumento de datos estándar: recorte aleatorio con cambio de tamaño, volteo horizontal, fluctuación de color, desenfoque gaussiano y solarización aleatoria. Para la pérdida por destilación, la pérdida de token de clase utiliza similitud de coseno, mientras que la pérdida de token de parche combina similitud de coseno (peso α=0,9) y pérdida suave L1 (peso β=0,1). Los módulos de cabezal adaptador (MLP de 2 capas) se adjuntan al estudiante para que coincidan con la dimensión de la característica de cada maestro. Si las dimensiones espaciales de los tokens de parches de estudiantes y profesores difieren, se aplica una interpolación bicúbica 2D para alinearlas.
Etapa 3: ajuste fino de resolución múltiple. A partir del punto de control de la Etapa 2, el estudiante pasa por una fase de ajuste más corta utilizando una pirámide de imágenes de tres escalas: 256, 384 y 512. El estudiante y el maestro sustituto seleccionan de forma independiente y aleatoria una escala por iteración, para que puedan procesar la misma imagen en diferentes resoluciones. Esto obliga al estudiante a aprender representaciones que se generalizan a través de granularidades espaciales, acomodando tareas posteriores que operan en varias resoluciones. Esta etapa se ejecuta durante 100.000 iteraciones con un tamaño de lote de 4.096 y una tasa de aprendizaje base de 1e-5. Es intencionalmente más corto porque el entrenamiento de múltiples resoluciones es computacionalmente costoso: una iteración en la Etapa 3 lleva aproximadamente el doble que en la Etapa 2.
Datos de entrenamiento. Las tres etapas utilizan el mismo conjunto de datos DINOv3, LVD-1689M, que proporciona una cobertura equilibrada de conceptos visuales de la web junto con conjuntos de datos públicos de alta calidad, incluido ImageNet-1k. La probabilidad de muestreo de ImageNet-1k es del 10%, y el 90% restante de LVD-1689M. En un estudio de ablación, el entrenamiento con LVD-1689M superó consistentemente al entrenamiento con MetaCLIP (2,5 mil millones de imágenes) en casi todos los puntos de referencia, a pesar de que MetaCLIP tiene aproximadamente 800 millones de imágenes más grande, lo que indica una mayor calidad de datos en LVD.
Un resultado negativo importante: no todos los profesores se compaginan bien
Uno de los hallazgos más útiles en la práctica tiene que ver con la selección de docentes. Intuitivamente, agregar más maestros fuertes debería ayudar. Pero el equipo de investigación descubrió que incluir SigLIP2-G junto con PEcore-G y DINOv3-H+ degrada sustancialmente el rendimiento del OCR. A nivel del modelo proxy, TextVQA cae de 56,2 a 53,2; en el nivel de estudiantes ViT-B baja de 48,6 a 44,8. La hipótesis de los equipos de investigación: tener dos modelos de estilo CLIP (PEcore-G y SigLIP2-G) en el conjunto del profesor simultáneamente provoca incompatibilidad de características. PElang-G, un modelo centrado en el lenguaje derivado de PEcore-G mediante la alineación con modelos de lenguaje, demostró ser un complemento mucho mejor: mejoró el rendimiento de OCR y VLM general sin sacrificar la comprensión de imágenes o la predicción densa.
Lo que dicen los números
Los estudios de ablación validan el diseño de tres etapas. Destilar directamente de varios profesores a un estudiante eficiente (“solo Etapa 2”) produce un rendimiento VLM deficiente, especialmente en tareas de tipo OCR, y una predicción densa deficiente. Agregar la Etapa 1 (el modelo proxy) mejora significativamente las tareas VLM (TextVQA aumenta de 46,8 a 48,3 y Realworld de 53,5 a 55,1), pero aún se queda atrás en tareas densas. La etapa 1+3 (omitiendo la etapa 2) proporciona los resultados de predicción más densos (SPair: 53,3, NYUv2: 0,388), pero deja lagunas en VLM y su ejecución durante un cronograma completo es costosa. El proceso completo de tres etapas logra el mejor equilibrio general.
En el principal índice de referencia ViT-B, EUPE-ViT-B destaca consistentemente:
Comprensión de imágenes: EUPE logra 84,1 en IN1k-KNN, superando a PEcore-B (79,7), SigLIP2-B (83,2) y DINOv3-ViT-B (83,0). En IN1k-ZS (disparo cero), obtiene una puntuación de 79,7, superando a PEcore-B (78,4) y SigLIP2-B (78,2). Predicción densa: EUPE alcanza 52,4 mIoU en ADE20k, superando al experto en predicción densa DINOv3-ViT-B (51,8). En la correspondencia semántica SPair-71k, obtiene una puntuación de 51,3, igualando a DINOv3-ViT-B. Modelado de lenguaje de visión: EUPE supera tanto a PEcore-B como a SigLIP2-B en RealworldQA (55,5 frente a 52,9 y 52,5) y GQA (67,3 frente a 65,6 y 65,2), sin dejar de ser competitivo en TextVQA, SQA y POPE. vs. Métodos aglomerativos: EUPE supera a RADIOv2.5-B y DUNE-B en todas las tareas VLM y en las tareas de predicción más densas por márgenes significativos.
Cómo se ven realmente las características
La investigación también incluye la visualización de características cualitativas mediante la proyección PCA de tokens de parche en el espacio RGB, una técnica que revela la estructura espacial y semántica que ha aprendido un codificador. Los resultados son reveladores:
Los tokens de parche PEcore-B y SigLIP2-B contienen información semántica pero no son espacialmente consistentes, lo que genera representaciones ruidosas. DINOv3-ViT-B tiene características muy nítidas y semánticamente coherentes, pero carece de discriminación detallada (la comida y los platos terminan con representaciones similares en el ejemplo de la última fila). Las funciones de RADIOv2.5-B son demasiado sensibles y rompen la coherencia semántica; por ejemplo, el pelaje de perro negro se fusiona visualmente con el fondo. EUPE-ViT-B combina coherencia semántica, granularidad fina, estructura espacial compleja y conocimiento del texto simultáneamente, capturando las mejores cualidades de todos los expertos del dominio a la vez.
Una familia completa de modelos listos para Edge
EUPE es una familia completa que abarca dos tipos de arquitectura:
Familia ViT: ViT-T (6M parámetros), ViT-S (21M), ViT-B (86M) Familia ConvNeXt: ConvNeXt-Tiny (29M), ConvNeXt-Small (50M), ConvNeXt-Base (89M)
Todos los modelos tienen parámetros inferiores a 100M. La latencia de inferencia se mide en la CPU del iPhone 15 Pro a través de modelos exportados por ExecuTorch. Con una resolución de 256 × 256: ViT-T se ejecuta en 6,8 ms, ViT-S en 17,1 ms y ViT-B en 55,2 ms. Las variantes de ConvNeXt tienen FLOP más bajos que los ViT de tamaño similar, pero no necesariamente logran una menor latencia en la CPU, porque las operaciones convolucionales a menudo son menos eficientes en la arquitectura de la CPU en comparación con las operaciones de multiplicación de matrices altamente optimizadas (GEMM) utilizadas en los ViT.
Para la familia ConvNeXt, EUPE supera consistentemente a la familia DINOv3-ConvNeXt de los mismos tamaños en las variantes Tiny, Small y Base en predicción densa, al tiempo que desbloquea una mejor capacidad VLM, particularmente para OCR y tareas centradas en la visión, de la que DINOv3-ConvNeXt carece por completo.
Conclusiones clave
Un codificador para gobernarlos a todos. EUPE es un codificador de visión compacto único (con menos de 100 millones de parámetros) que iguala o supera a los modelos especializados de expertos en el dominio en comprensión de imágenes, predicción densa y modelado de visión y lenguaje, tareas que antes requerían codificadores separados y dedicados. Aumente la escala antes de reducirla. La innovación central es un proceso de destilación de “maestros sustitutos” de tres etapas: primero agrega conocimiento de múltiples modelos expertos grandes en un proxy de 1.900 millones de parámetros, luego destila de ese único maestro unificado a un estudiante eficiente, en lugar de destilarlo directamente de varios maestros a la vez. La selección de profesores es una decisión de diseño, no un hecho. Agregar más profesores no siempre ayuda. La inclusión de SigLIP2-G junto con PEcore-G degradó significativamente el rendimiento del OCR. PElang-G resultó ser el complemento VLM adecuado: un hallazgo con implicaciones prácticas directas para cualquiera que esté construyendo canales de destilación de múltiples profesores. Creado para una implementación real en el borde. La familia EUPE completa abarca seis modelos en arquitecturas ViT y ConvNeXt. El más pequeño, ViT-T, se ejecuta en 6,8 ms en la CPU del iPhone 15 Pro. Todos los modelos se exportan a través de ExecuTorch y están disponibles en Hugging Face, listos para la integración en el dispositivo, no solo para la evaluación comparativa. La calidad de los datos supera a la cantidad de datos. En experimentos de ablación, el entrenamiento con LVD-1689M superó al entrenamiento con MetaCLIP en casi todos los puntos de referencia, a pesar de que MetaCLIP contenía aproximadamente 800 millones de imágenes más. Un recordatorio útil de que conjuntos de datos más grandes no significan automáticamente mejores modelos.
Consulte el papel, el peso del modelo y el repositorio. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros