Búsqueda de imágenes en 5 minutos.  Búsqueda de imágenes de última generación, sencilla y… |  de Daniel Warfield |  octubre de 2023

Búsqueda de imágenes de última generación, sencilla y rápida

“Pesaje de vectores” del autor utilizando MidJourney. Todas las imágenes del autor a menos que se especifique lo contrario.

En esta publicación implementaremos la búsqueda de texto a imagen (que nos permite buscar una imagen a través de texto) y la búsqueda de imagen a imagen (que nos permite buscar una imagen basada en una imagen de referencia) usando un pre- modelo entrenado. El modelo que usaremos para calcular la similitud de imágenes y textos está inspirado en el Entrenamiento previo de imágenes en lenguaje contrastivo (CLIP), que analizo en otro articulo.

Los resultados al buscar imágenes con el texto “un arco iris junto al agua”

¿Para quién es esto útil? Cualquier desarrollador que quiera implementar la búsqueda de imágenes, científicos de datos interesados ​​en aplicaciones prácticas o lectores no técnicos que quieran aprender sobre la IA en la práctica.

¿Qué tan avanzada está esta publicación? Esta publicación lo guiará en la implementación de la búsqueda de imágenes de la manera más rápida y sencilla posible.

Requisitos previos: Experiencia básica en codificación.

Este artículo es un complemento de mi artículo sobre “Preentrenamiento de imagen y lenguaje contrastivo”. No dudes en consultarlo si quieres una comprensión más profunda de la teoría:

Los modelos CLIP están entrenados para predecir si un título arbitrario pertenece a una imagen arbitraria. Usaremos esta funcionalidad general para crear nuestro sistema de búsqueda de imágenes. Específicamente, usaremos los codificadores de imágenes y texto de CLIP para condensar las entradas en un vector, llamado incrustación, que puede considerarse como un resumen de la entrada.

El trabajo de un codificador es resumir una entrada en una representación significativa, llamada incrustación. Imagen de mi artículo sobre CLIP.

La idea detrás de CLIP es que textos e imágenes similares tendrán incrustaciones de vectores similares.