En esta publicación implementaremos la búsqueda de texto a imagen (que nos permite buscar una imagen a través de texto) y la búsqueda de imagen a imagen (que nos permite buscar una imagen basada en una imagen de referencia) usando un pre- modelo entrenado. El modelo que usaremos para calcular la similitud de imágenes y textos está inspirado en el Entrenamiento previo de imágenes en lenguaje contrastivo (CLIP), que analizo en otro articulo.
¿Para quién es esto útil? Cualquier desarrollador que quiera implementar la búsqueda de imágenes, científicos de datos interesados en aplicaciones prácticas o lectores no técnicos que quieran aprender sobre la IA en la práctica.
¿Qué tan avanzada está esta publicación? Esta publicación lo guiará en la implementación de la búsqueda de imágenes de la manera más rápida y sencilla posible.
Requisitos previos: Experiencia básica en codificación.
Este artículo es un complemento de mi artículo sobre “Preentrenamiento de imagen y lenguaje contrastivo”. No dudes en consultarlo si quieres una comprensión más profunda de la teoría:
Los modelos CLIP están entrenados para predecir si un título arbitrario pertenece a una imagen arbitraria. Usaremos esta funcionalidad general para crear nuestro sistema de búsqueda de imágenes. Específicamente, usaremos los codificadores de imágenes y texto de CLIP para condensar las entradas en un vector, llamado incrustación, que puede considerarse como un resumen de la entrada.
La idea detrás de CLIP es que textos e imágenes similares tendrán incrustaciones de vectores similares.