Meta AI presenta Meta Segment Anything Model 2 (SAM 2): el primer modelo unificado para segmentar objetos en imágenes y vídeos

Meta ha presentado SAM2la próxima generación de su modelo Segment Anything. Basándose en el éxito de su predecesor, SAM 2 es un modelo unificado innovador diseñado para la segmentación de objetos en tiempo real en imágenes y vídeos. SAM 2 amplía las capacidades del SAM original, centrado principalmente en imágenes. El nuevo modelo se integra perfectamente con los datos de vídeo, ofreciendo segmentación y seguimiento de objetos en tiempo real en todos los fotogramas. Esta capacidad se consigue sin necesidad de una adaptación personalizada, gracias a la capacidad de SAM 2 de generalizarse a dominios visuales nuevos e inéditos. La generalización de disparo cero del modelo significa que puede segmentar cualquier objeto en cualquier vídeo o imagen, lo que lo hace muy versátil y adaptable a diversos casos de uso.

Una de las características más destacables de SAM 2 es su eficiencia. Requiere menos tiempo de interacción, tres veces menos que los modelos anteriores, a la vez que logra una precisión superior en la segmentación de imágenes y videos. Esta eficiencia es crucial para aplicaciones prácticas donde el tiempo y la precisión son esenciales.

Las posibles aplicaciones de SAM 2 son amplias y variadas. Por ejemplo, en la industria creativa, el modelo puede generar nuevos efectos de vídeo, mejorando las capacidades de los modelos de vídeo generativos y abriendo nuevas vías para la creación de contenidos. En la anotación de datos, SAM 2 puede acelerar el etiquetado de datos visuales, mejorando así el entrenamiento de futuros sistemas de visión artificial. Esto es especialmente beneficioso para las industrias que dependen de grandes conjuntos de datos para el entrenamiento, como los vehículos autónomos y la robótica.

El SAM 2 es un modelo prometedor en los campos científico y médico, ya que puede segmentar células en movimiento en vídeos microscópicos, lo que facilita los procesos de investigación y diagnóstico. La capacidad del modelo para rastrear objetos en imágenes tomadas con drones puede ayudar a monitorear la vida silvestre y realizar estudios ambientales.

En consonancia con el compromiso de Meta con la ciencia abierta, el proyecto SAM 2 incluye la publicación del código y los pesos del modelo bajo una licencia Apache 2.0. Esta apertura fomenta la colaboración y la innovación dentro de la comunidad de IA, lo que permite a los investigadores y desarrolladores explorar nuevas capacidades y aplicaciones del modelo. Meta ha publicado el conjunto de datos SA-V, una colección completa de aproximadamente 51.000 vídeos del mundo real y más de 600.000 máscaras espaciotemporales, bajo una licencia CC BY 4.0. Este conjunto de datos es significativamente más grande que los conjuntos de datos anteriores, lo que proporciona un recurso valioso para entrenar y probar modelos de segmentación.

El desarrollo de SAM 2 implicó importantes innovaciones técnicas. La arquitectura del modelo se basa en las bases establecidas por SAM, ampliando sus capacidades para manejar datos de video. Esto implica un mecanismo de memoria que permite al modelo recuperar información procesada previamente y segmentar objetos con precisión en los fotogramas de video. El codificador de memoria, el banco de memoria y el módulo de atención de memoria son componentes críticos que permiten a SAM 2 gestionar las complejidades de la segmentación de video, como el movimiento, la deformación y la oclusión de objetos.

El equipo SAM 2 desarrolló una tarea de segmentación visual programable para abordar los desafíos que plantean los datos de video. Esta tarea permite que el modelo tome indicaciones de entrada en cualquier fotograma de video y prediga una máscara de segmentación, que luego se propaga a través de todos los fotogramas para crear una máscara espaciotemporal. Este proceso iterativo garantiza resultados de segmentación precisos y refinados.

En conclusión, SAM 2 ofrece capacidades de segmentación de objetos en tiempo real sin igual en imágenes y videos. Su versatilidad, eficiencia y naturaleza de código abierto lo convierten en una herramienta valiosa para muchas aplicaciones, desde industrias creativas hasta investigación científica. Al compartir SAM 2 con la comunidad global de IA, Meta fomenta la innovación y la colaboración, allanando el camino para futuros avances en la tecnología de visión artificial.

"Up until today, annotating masklets in videos has been clunky; combining the first SAM model with other video object segmentation models. With SAM 2 annotating masklets will reach a whole new level. I consider the reported 8x speedup to be the lower bound of what is achievable with the right UX, and with +1M inferences with SAM on the Encord platform, we’ve seen the tremendous value that these types of models can provide to ML teams. " - Dr Frederik Hvilshøj - Head of ML at Encord

Revisar la Papel, Descargar el modelo, Conjunto de datosy Pruebe la demostración aquíTodo el crédito por esta investigación corresponde a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y únete a nuestro Canal de Telegram y LinkedIn Gr¡Arriba!. Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..

No olvides unirte a nuestro Más de 47 000 suscriptores de ML en Reddit

Encuentra lo próximo Seminarios web sobre IA aquí


Asif Razzaq es el director ejecutivo de Marktechpost Media Inc. Como ingeniero y emprendedor visionario, Asif está comprometido con aprovechar el potencial de la inteligencia artificial para el bien social. Su iniciativa más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad de noticias sobre aprendizaje automático y aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.