Robbyant, la empresa de IA incorporada dentro de Ant Group, tiene LingBot-Vision de código abierto, una familia de Vision Transformers autosupervisados creados para una percepción espacial densa. Los pesos se envían bajo Apache-2.0 en Hugging Face en cuatro tamaños (ViT-giant, ViT-large, ViT-base y ViT-small) junto con un informe técnico y un código de inferencia.
La mayoría de los modelos básicos de visión están entrenados para la invariancia semántica: aprenden a responder lo que hay en una imagen mientras descartan exactamente la estructura espacial detallada (límites de objetos, contornos, discontinuidades de profundidad) de la que dependen los robots y otros sistemas físicamente incorporados. LingBot-Vision invierte esa prioridad. Trata los límites como una señal nativa de preentrenamiento en lugar de una salida descendente, y la recompensa es una columna vertebral de parámetros 1B que iguala o supera modelos hasta 7 veces más grandes en tareas espaciales densas, incluido el 7B DINOv3.
¿Qué es LingBot-Vision?
LingBot-Vision es un codificador preentrenado y autosupervisado para tareas posteriores estructuradas espacialmente. El buque insignia ViT-g/16 tiene aproximadamente 1,1 mil millones de parámetros y está entrenado con un nuevo objetivo llamado modelado de límites enmascarados en un corpus curado de alrededor de 161 millones de imágenes (seleccionadas de un grupo web de 2 mil millones) sin etiquetas humanas, sin detectores de bordes externos y sin una columna vertebral previamente entrenada desde la cual arrancar. El entrenamiento también es notablemente económico: el corpus es un orden de magnitud más pequeño que el LVD-1689M de DINov3 y el modelo consume menos de un tercio de las muestras de entrenamiento de DINov3.
El codificador genera características densas de tokens de parche destinadas a lecturas congeladas. Para la implementación con presupuestos más pequeños, el buque insignia se divide en estudiantes de ViT-L (300 millones), ViT-B (86 millones) y ViT-S que lideran predicciones densas dentro de sus clases de tamaño.
Cómo funciona el modelado de límites enmascarados
El método se basa en el paradigma de autodestilación DINO/iBOT: un profesor (una copia EMA del estudiante) genera objetivos en línea y el estudiante los recupera a partir de vistas enmascaradas.
El modelado de imágenes enmascaradas estándar oculta parches al azar, ignorando lo que representa cada parche. Es barato recuperar una parcela interior plana de sus vecinos; un parche que se extiende a ambos lados del límite de un objeto conlleva una estructura que el contexto por sí solo no puede proporcionar. Los límites son las regiones menos redundantes y más informativas de una imagen, y el enmascaramiento aleatorio las trata como a todo lo demás.
LingBot-Vision cierra esa brecha con dos ideas.
Forzar límites. El profesor predice un campo de límites denso en línea e identifica los tokens B que contienen límites. Estos se introducen en el conjunto enmascarado del estudiante encima de la máscara aleatoria M, dando la máscara combinada M⁺ = M ∪ B. Los tokens enmascarados luego se enrutan por geometría: los tokens de límites reciben un objetivo geométrico explícito además del objetivo de autodestilación semántica, mientras que los tokens enmascarados interiores mantienen solo el objetivo semántico estándar. Esta ruta es importante porque un objetivo semántico es inherentemente ambiguo exactamente donde se encuentran dos regiones: el objetivo geométrico está bien planteado precisamente donde el modelado enmascarado convencional es más débil, que es lo que permite que las representaciones semánticas y geométricas coemerjan en lugar de competir.
Campo de límite categórico. Los límites se modelan como segmentos de línea elevados a un campo denso: cada píxel cercano almacena un vector de atributos a(p) = (d, θ, φ¹, φ²) que registra su distancia al segmento más cercano y tres ángulos que lo ubican. La regresión directa de este campo en un bucle profesor-alumno colapsa. La solución es discretizar cada canal en K = 32 contenedores, reformulando la predicción de límites como una clasificación por píxel, lo que permite que la rama de límite herede la misma maquinaria de centrado y afilado que estabiliza la autodestilación moderna.
La forma categórica tiene un efecto secundario elegante. Según la clásica hipótesis nula a contraria de “no estructura”, las orientaciones de los límites se distribuyen uniformemente, y esa nula es ahora literalmente la distribución uniforme entre contenedores. La desviación de la uniformidad es evidencia de un límite real, por lo que una prueba de Número de falsas alarmas (NFA) sin parámetros valida cada segmento decodificado sin costo adicional. El profesor explota esto en cada iteración: decodifica segmentos candidatos de su propia predicción de campo, conserva solo los supervivientes validados por la NFA y los vuelve a representar en el campo objetivo, de modo que una estructura sin soporte nunca se convierte en una señal de enseñanza.
El objetivo completo resume cuatro términos:
L = L_DINO + λᵢ · L_iBOT + λᵦ · L_bnd + λₖ · L_KoLeo
Puntos de referencia y rendimiento
Todos los resultados densos que aparecen a continuación utilizan funciones congeladas con una única capa lineal, por lo que el rendimiento es atribuible a la representación y no a un decodificador.
En NYU-Depth v2, LingBot-Vision publica el mejor RMSE de toda la comparación (0,296), por delante del 7B DINOv3 (0,309) con aproximadamente 7 veces menos parámetros y por delante del 2B V-JEPA 2.1 (0,307). En KITTI es el mejor modelo por debajo de los parámetros 2B. En segmentación semántica, está a la par con el DINov3 ViT-H+ destilado (1,3 mIoU por detrás en ADE20K, igualando en Cityscapes, por delante en VOC12), mientras mejora con respecto al DINov2 del mismo tamaño en 4+ mIoU en los tres puntos de referencia; la única brecha que queda es la propia familia DINOv3 (2,4 mIoU en ADE20K para el modelo 7B), cuya fuerza densa proviene de la destilación y objetivos dedicados de características densas.
La segmentación de objetos de vídeo utiliza la propagación de etiquetas sin entrenamiento sobre funciones congeladas. LingBot-Vision alcanza 70,0 J&F en DAVIS-2017 y 73,5 en YouTube-VOS, a la par con DINOv3 ViT-H+ (71,1/74,0) y 7B DINOv3 (71,1/74,1), y el mejor entre todos los modelos restantes en cualquier escala. Los propios tokens de límite son lo suficientemente estables como para ser rastreados a través de video mediante una simple similitud coseno de características congeladas, sin supervisión temporal.
La compensación es el reconocimiento a nivel de imagen: el sondeo lineal ImageNet-1K alcanza 86,32 y k-NN 83,39, detrás de DINOv3-7B, que gasta su capacidad en invariancia a nivel de imagen. Las ventajas también sobreviven a la destilación: el estudiante ViT-L de 0,3 mil millones iguala al DINOv3 de 7 mil millones en profundidad NYUv2 (0,310 frente a 0,309) con aproximadamente 23 veces menos parámetros.
Casos de uso y cómo cargarlos
Los tokens de parche congelados sirven directamente para varias cargas de trabajo densas: la estimación de profundidad lee la geometría directamente de las características, la segmentación semántica se beneficia de las transiciones de características que aterrizan exactamente en los contornos de los objetos y la segmentación de objetos de video funciona mediante la coincidencia de tokens de similitud de coseno. El codificador también sirve como inicialización para el entrenamiento de finalización en profundidad posterior.
La carga de una red troncal sigue el repositorio oficial:
El argumento variante selecciona el tamaño y el valor predeterminado es grande. Los patch_tokens de salida tienen forma [B, H*W, C]. Los requisitos son Python ≥ 3.10 y PyTorch ≥ 2.0, con una GPU recomendada para las redes troncales más grandes.
LingBot-Depth 2.0: la recompensa posterior
Para mostrar lo que compra un codificador nativo de percepción espacial en sentido descendente, el equipo actualizó su sistema de finalización de profundidad a LingBot-Depth 2.0. La receta de modelado de profundidad enmascarada no ha cambiado desde la versión 1.0; exactamente dos ingredientes se movieron: la inicialización del codificador cambió de DINOv2 a LingBot-Vision (en variantes ViT-L y ViT-g), y los datos de entrenamiento seleccionados aumentaron de las muestras de 3M publicadas públicamente a 150M.
Esos dos cambios establecieron resultados líderes en 14 puntos de referencia de finalización de profundidad que abarcan regímenes de máscara de bloque, dispersos y de sensores reales. En DIODE-Indoor con máscara de bloque, el RMSE se reduce a la mitad, de 0,132 a 0,062. El sistema es más potente en las capturas ClearGrasp de objetos transparentes (0,010 / 0,012 RMSE), el clásico caso de falla de la detección activa de profundidad.
En particular, los dos cambios se combinan en lugar de cancelarse: a medida que los datos de entrenamiento crecen de 3M a 150M, la curva inicializada por DINOv2 se satura más allá de los 20M de muestras mientras que la curva LingBot-Vision sigue mejorando. Más datos amplifican, en lugar de anular, la ventaja de un mejor punto de partida.
Conclusiones clave
LingBot-Vision convierte los límites en una señal nativa de preentrenamiento, arrancada a partir de imágenes sin formato sin etiquetas, detectores de bordes ni redes troncales previamente entrenadas. El forzado de límites más un campo de límite categórico permite que la geometría y la semántica co-emerjan, y produce una prueba de validación NFA sin parámetros de forma gratuita. La columna vertebral 1B presenta el mejor RMSE NYU-Depth v2 en su comparación, por delante del 7B DINOv3, mientras entrena en un corpus más pequeño de un orden de magnitud. Las ventajas sobreviven a la destilación: el 0.3B ViT-L coincide con el 7B DINOv3 en NYUv2 con ~23 veces menos parámetros. Al intercambiar solo el codificador y los datos de escala, LingBot-Depth 2.0 obtuvo resultados líderes en 14 puntos de referencia de finalización de profundidad, y el borde del codificador se amplía con más datos. Los pesos se envían bajo Apache-2.0 en tamaños ViT-g/L/B/S para cada presupuesto de implementación.
Explicador dinámico interactivo
Nota: Gracias al equipo de Ant Research por el liderazgo intelectual y los recursos para este artículo. El equipo de Ant Research ha apoyado este contenido/artículo para su promoción.