“La belleza salvará al mundo” – Fiódor Dostoievski
A. Introducción
no surgió de la noche a la mañana. Los sistemas actuales basados en transformadores pueden parecer casi mágicos, capaces de capturar el contexto e incluso relaciones sutiles entre ideas. Pero el origen de los sistemas de búsqueda semántica actuales es en realidad gradual. Antes de las incrustaciones, los transformadores y los grandes modelos de lenguaje, los investigadores utilizaban la concordancia de palabras clave, los vectores TF-IDF y métodos tradicionales de aprendizaje automático para analizar texto.
Muchas de esas ideas anteriores nunca desaparecieron del todo. De hecho, los sistemas modernos todavía se basan en conceptos desarrollados hace décadas. El campo evolucionó capa por capa, y cada generación resolvió algunos problemas y expuso otros nuevos.
Entender que la evolución es importante. En el aprendizaje automático, como en la ciencia en general, saber de dónde venimos a menudo nos ayuda a comprender hacia dónde nos dirigimos. La historia de la búsqueda semántica es también la historia de un cambio importante en la propia IA: de sistemas transparentes diseñados por humanos a modelos cada vez más inteligentes cuyo razonamiento interno es mucho más difícil de interpretar. De esa manera, pasamos de reglas de recuperación explícitas y características diseñadas manualmente a sistemas capaces de aprender representaciones abstractas de significado directamente a partir de datos.
En este artículo, exploraremos esa progresión a través de un ejemplo concreto: comparando la crítica de arte de un estudiante con críticas escritas por expertos sobre la misma pintura. En lugar de saltar inmediatamente a incrustaciones y transformadores, construiremos una secuencia de sistemas de recuperación cada vez más sofisticados, examinando tanto sus fortalezas como sus limitaciones.
Cubriremos cuatro etapas principales en la evolución de la búsqueda semántica:
Método 1: Funciones de recuperación artesanales + TF–IDF
Un sistema de clasificación transparente que combina la similitud del coseno TF-IDF con características interpretables como la superposición de palabras clave, la normalización de la duración de las críticas y la ponderación de lo reciente. Método 2: aprendizaje automático clásico para clasificación semántica
Uso de vectores de características TF-IDF junto con modelos de aprendizaje supervisados, como la regresión logística, para aprender el comportamiento de clasificación a partir de ejemplos etiquetados. Método 3: búsqueda semántica basada en incrustaciones
Reemplazar representaciones léxicas escasas con incrustaciones semánticas densas generadas por Sentence Transformers. Método 4: ajuste fino del transformador
Ajuste de arquitecturas transformadoras previamente entrenadas, como BERT, para modelar directamente las relaciones semánticas entre críticas.
La Figura 1 a continuación muestra la evolución de los métodos de búsqueda semántica.
Al final, construiremos canales de búsqueda semántica cada vez más capaces. Además, obtendremos información sobre cómo evolucionó el campo en sí, es decir, desde sistemas impulsados en gran medida por características diseñadas por humanos hasta modelos que aprenden el significado directamente de los datos.
B. Datos
Para mantener el foco en la búsqueda semántica en lugar de la ingeniería de conjuntos de datos, utilizaremos un pequeño conjunto de datos sintéticos de críticas de arte. El conjunto de datos fue diseñado intencionalmente para imitar diferencias realistas en vocabulario, estilo de escritura, interpretación y profundidad analítica entre los críticos que discuten la misma pintura.
Cada crítica contiene metadatos y texto de formato libre. Nuestra tarea a lo largo del artículo será comparar la crítica de un nuevo estudiante con críticas de expertos de la misma pintura y determinar la similitud semántica utilizando métodos de recuperación progresivamente más avanzados.
La estructura de cada crítica se representa mediante una clase de datos simple de Python:
@dataclass clase Crítica: critique_id: str pintura_id: str nombre_crítico: str título: str texto: str publicado_at: fecha y hora
El campo de texto anterior contiene el contenido de la crítica principal utilizado para el análisis semántico, mientras que campos como pintura_id, nombre_crítico y publicado_at proporcionan metadatos que pueden respaldar experimentos de filtrado, agrupación o clasificación.
Una crítica típica podría verse así:
Critique( critique_id="c102", pintura_id="noche_estrellada", critic_name="Dr. Elaine Foster", title="Emoción a través del movimiento", text=""" Van Gogh transforma el cielo nocturno en una estructura que parece viva. Las pinceladas arremolinadas generan tensión en el alma mientras el brillo exagerado de las estrellas crea una atmósfera de ensueño. """, publicado_at=datetime(2021, 5, 12) )
Aunque sintético, el conjunto de datos es lo suficientemente rico como para demostrar las ideas centrales detrás de los sistemas de recuperación semántica, desde una simple similitud basada en palabras clave hasta representaciones de significado basadas en transformadores.
Tenga en cuenta que el código para los cuatro métodos está disponible en Github. El directorio exacto se muestra al final del artículo.
C. Métodos
C.1 Método 1: recuperación basada en reglas y clasificación TF-IDF
Comenzamos con uno de los enfoques más clásicos e interpretables de la búsqueda semántica: combinar la clasificación TF-IDF con un pequeño conjunto de funciones de recuperación artesanales. Aunque es simple en comparación con los sistemas modernos de aprendizaje profundo, este enfoque captura muchas de las ideas centrales detrás de la recuperación de documentos y la puntuación de similitudes. En esta etapa, el sistema no “entiende” realmente el lenguaje. En cambio, identifica patrones en el uso de palabras y los combina con heurísticas de puntuación diseñadas manualmente.
La base del método es TF-IDF (Frecuencia de términos-Frecuencia de documentos inversa), una técnica clásica para convertir texto en vectores numéricos. TF–IDF aumenta la importancia de las palabras que aparecen con frecuencia dentro de un documento pero que siguen siendo relativamente poco comunes en la colección más grande. Palabras comunes como “el” o “pintura” reciben muy poco peso, mientras que términos más distintivos como “composición”, “contraste” o “simbolismo” se vuelven más influyentes.
Después de adaptar el vectorizador TF-IDF a las críticas de los expertos, el sistema produce una matriz dispersa de términos de documentos almacenada en self.matrix. Cada fila corresponde a una crítica, cada columna corresponde a un término o frase aprendida y los valores numéricos representan ponderaciones TF-IDF.
Una vez que las críticas han sido vectorizadas, la similitud del coseno se puede utilizar para medir la similitud de los documentos. La similitud del coseno mide el ángulo entre dos vectores en un espacio de alta dimensión. Cuando dos críticas utilizan vocabulario similar en proporciones similares, producen vectores que apuntan en direcciones similares y, por lo tanto, reciben puntuaciones de similitud más altas.
Sin embargo, en la práctica, la similitud entre el FT y las FDI por sí sola no suele ser suficiente. Dos críticas pueden describir ideas artísticas similares con términos muy diferentes, mientras que otras pueden parecer artificialmente similares simplemente porque comparten terminología técnica. Para mejorar la calidad de la recuperación, combinamos la similitud TF-IDF con varias características heurísticas adicionales.
El sistema de puntuación heurístico incluye:
Superposición de palabras clave: mide cuántas palabras importantes se comparten entre las críticas. Normalización de longitud: recompensa las críticas que contienen un nivel significativo de detalle descriptivo sin favorecer el texto excesivamente largo. Ponderación de actualidad: favorece suavemente las críticas más nuevas utilizando una caída temporal exponencial.
La puntuación de la clasificación final se calcula como:
puntuación=1.2∗tfidf_similarity+0.6∗keyword_overlap+0.2∗length_norm+0.15∗recencyscore=1.2*tfidf_similarity+0.6*keyword_overlap+0.2*length_norm+0.15*recencia (Ecuación 1)
Cada característica está restringida intencionalmente entre 0 y 1. Seguimos aplicando el recorte como una simple verificación de seguridad:
np.clip(valor, 0.0, 1.0)
En nuestro caso, el recorte funciona bien porque las entidades ya están delimitadas de forma natural. Sin embargo, en sistemas de producción más grandes, las características con rangos numéricos más amplios, como estadísticas de popularidad o recuentos de citas, normalmente requerirían normalización.
La función de normalización de longitud recompensa las críticas que proporcionan suficientes detalles descriptivos. Si la extensión objetivo es de 250 palabras, la puntuación se convierte en:
length_norm=min(word_count250,1)length_norm = minleft(frac{palabra_count}{250}, 1right) (Ecuación 2)
Por ejemplo, una crítica de 125 palabras recibe una puntuación de 0,5. Las críticas con 250 palabras o más reciben la puntuación máxima de 1,0.
La función de actualidad introduce una preferencia por las críticas más nuevas, pero aún permite que las reseñas más antiguas sigan siendo relevantes:
recency=0.5(age_dayshalf_life_days)recencia = 0.5^{left(frac{age_days}{half_life_days}right)} (Ecuación 3)
Utilizando una vida media de aproximadamente 10 años:
Una crítica escrita hoy recibe una puntuación cercana a 1,0. Una crítica escrita hace 10 años recibe aproximadamente 0,5. Una crítica escrita hace 20 años recibe aproximadamente 0,25.
Esto crea una noción fluida de "frescura" similar a las estrategias utilizadas históricamente en los motores de búsqueda y los sistemas de recomendación.
Una de las mayores fortalezas de este enfoque es la interpretabilidad. Cada parte del proceso de clasificación es visible y comprensible. Podemos inspeccionar exactamente por qué una crítica se ubicó por encima de otra simplemente examinando la contribución de cada característica.
Para probar el método, construimos un pequeño conjunto de datos sintéticos de críticas de expertos que analizan la misma pintura. Luego enviamos una nueva crítica de un estudiante y le pedimos al sistema que recupere los análisis de expertos más similares. La nueva crítica de los estudiantes es:
Student_critique_text = """ La pintura crea una atmósfera emocional tranquila, pero muy poderosa. La luz suave y la paleta de colores sobria hacen que la figura central se sienta aislada pero digna. El fondo no compite con el sujeto; en cambio, profundiza el estado de ánimo de reflexión y quietud. En general, la obra se siente íntima, psicológica y cuidadosamente compuesta. """
Al final, el programa calcula una puntuación de similitud entre la crítica de los estudiantes y las críticas de los expertos, como se muestra a continuación en la Tabla 1.
La clasificación tiene sentido. La crítica de los estudiantes hizo hincapié en la iluminación suave, la moderación de las emociones y la atmósfera psicológica. Estos son temas que se superponen fuertemente con el lenguaje utilizado en dos críticas de expertos, tituladas respectivamente, Luz y quietud e Interior psicológico. Las críticas centradas principalmente en el simbolismo, la pincelada técnica o la interpretación histórica recibieron puntuaciones más bajas porque compartían menos similitudes léxicas y heurísticas.
Al mismo tiempo, las limitaciones del FT-FDI ya se están haciendo visibles. El método captura principalmente patrones de vocabulario superficiales en lugar de significados semánticos más profundos. Por ejemplo, frases como “uso dramático de la luz” y “fuertes efectos de claroscuro” pueden referirse a ideas artísticas muy similares aunque comparten pocas palabras exactas. Los sistemas de recuperación clásicos suelen tener problemas en estas situaciones porque dependen en gran medida de la superposición léxica.
Estas limitaciones motivan la siguiente etapa en la evolución de la búsqueda semántica: modelos de aprendizaje automático que aprenden el comportamiento de clasificación directamente a partir de datos en lugar de depender principalmente de reglas de puntuación diseñadas manualmente.
C.2 Método 2: aprendizaje automático clásico con funciones TF-IDF
El siguiente paso evolutivo en la búsqueda semántica reemplaza las reglas de puntuación diseñadas manualmente por aprendizaje automático supervisado. En lugar de decidir explícitamente cuánta importancia asignar a la similitud TF-IDF, la superposición de palabras clave u otras características heurísticas, permitimos que un modelo aprenda patrones útiles directamente a partir de ejemplos etiquetados.
Para este método, utilizamos una colección de críticas de pintura diferente a la introducida en el método anterior. En este conjunto de datos, algunas críticas están etiquetadas como “de expertos”, mientras que otras están etiquetadas como análisis de nivel más novato o principiante. En lugar de clasificar las críticas por similitud, el objetivo aquí es entrenar un clasificador que pueda predecir si una crítica se parece al análisis de un experto.
Como antes, lo primero que hacemos es la vectorización TF-IDF. Cada crítica se convierte en un vector numérico de alta dimensión cuyos valores representan la importancia de las palabras y frases dentro de la colección de documentos. Sin embargo, en lugar de comparar vectores directamente utilizando la similitud del coseno, incorporamos estas características TF-IDF a un modelo de aprendizaje supervisado como la regresión logística.
La regresión logística es uno de los métodos clásicos de aprendizaje automático para la clasificación. En lugar de utilizar reglas diseñadas manualmente, el modelo aprende patrones directamente de los ejemplos. Aprende qué palabras y estilos de escritura son más comunes en las críticas de expertos y luego utiliza estos patrones para evaluar nuevas críticas automáticamente. Este es un cambio importante porque el sistema ahora aprende de los datos en lugar de depender de reglas hechas a mano.
El fragmento de código muestra la canalización que consta de TfIdfVectorizer y Regresión logística.
modelo = Pipeline([ ("tfidf", TfidfVectorizer( ngram_range=(1, 2), minúsculas=True, min_df=1, stop_words="english" )), ("clasificador", LogisticRegression()) ])
Después del entrenamiento, el modelo puede analizar la crítica de un nuevo estudiante y producir ambas cosas:
una etiqueta de clase prevista una puntuación de probabilidad que indica la probabilidad de que la crítica sea similar a la de un experto
Una probabilidad cercana a 1 indica una gran similitud con las críticas de expertos, mientras que una probabilidad cercana a 0 sugiere una escritura de nivel principiante. De forma predeterminada, a las probabilidades mayores o iguales a 0,5 se les asigna la etiqueta 1 (“similar a un experto”), mientras que a las probabilidades inferiores a 0,5 se les asigna la etiqueta 0. Nuestra nueva crítica recibió una etiqueta de 1 y tenía una probabilidad de 0,672.
Uno de los aspectos más interesantes de la regresión logística es la interpretabilidad. Debido a que el modelo aprende coeficientes numéricos para cada característica TF-IDF, podemos inspeccionar directamente qué palabras y frases influyen en las decisiones de clasificación.
En este experimento, el clasificador dio mayor peso a términos como “ubicación”, “emocional”, “profundidad”, “psicológica”, “intensidad” y “sombra”. Cuando leemos las críticas mismas, este resultado parece razonable porque estas expresiones suelen aparecer en críticas de expertos que analizan la estructura, el simbolismo, la interpretación o la organización espacial con más detalle. En comparación, frases como “hermosa”, “se busca artista” y “pensar” recibieron menor peso. Estas frases son más comunes en críticas de novatos, que se centran en impresiones generales más que en análisis detallados. Después del entrenamiento, podemos inspeccionar los coeficientes aprendidos y ver qué palabras influyeron en las predicciones.
Al mismo tiempo, debemos tener cuidado de no exagerar lo que hace el modelo. En realidad, el modelo no interpreta la obra de arte ni aprecia su simbolismo como lo haría un experto humano. Se trata sólo de identificar patrones en el lenguaje utilizado en las críticas. Si los expertos utilizan constantemente términos como "profundidad" y "tensión psicológica", el modelo aprende que estos patrones se correlacionan con la escritura de nivel experto.
Esta limitación se vuelve más fácil de ver cuando dos críticas expresan ideas similares utilizando términos muy diferentes. La regresión logística funciona mejor cuando se expresan ideas similares con palabras similares. Si el vocabulario cambia demasiado, el modelo puede perder la conexión entre las críticas. Este problema llevó a los investigadores a utilizar métodos basados en incrustaciones que intentan capturar el significado en lugar de simplemente hacer coincidir palabras.
C.3 Método 3: búsqueda semántica basada en incrustaciones
El siguiente gran paso en la búsqueda semántica va más allá de TF-IDF y el simple recuento de palabras. En lugar de representar el texto como frecuencias de palabras, los sistemas modernos utilizan densas incrustaciones semánticas generadas por modelos de lenguaje basados en transformadores.
Esta es la etapa en la que el sistema comienza a ir más allá del simple vocabulario y comienza a capturar el significado real. Dos críticas pueden utilizar un lenguaje muy diferente para describir una idea artística y, sin embargo, se las reconoce como similares.
Para crear las incrustaciones, utilizamos un modelo Sentence Transformer del ecosistema Hugging Face. Sentence Transformers transforma oraciones o documentos completos en densos vectores numéricos. Estos vectores están diseñados para capturar el significado del texto y las relaciones entre diferentes escritos.
Por ejemplo, frases como:
“uso dramático de la luz” “iluminación cuidadosa” “fuertes efectos de claroscuro”
Se ven muy diferentes, pero expresan ideas artísticas estrechamente relacionadas. A diferencia de TF-IDF, los modelos integrados a menudo pueden reconocer estas relaciones semánticas. A diferencia del modelo de regresión logística del Método 2, el modelo de incrustación no asigna coeficientes explícitos a palabras individuales como "contraste" o "psicológico". En cambio, la información semántica se distribuye en muchas dimensiones del espacio de incrustación. Esto hace que las representaciones sean más difíciles de interpretar directamente, pero también mucho más flexibles semánticamente.
Para el Método 3, presentamos un nuevo conjunto de críticas diseñadas para encontrar similitudes semánticas a un nivel más profundo. Algunas críticas utilizan un lenguaje muy técnico, mientras que otras describen ideas artísticas similares de una manera más natural o indirecta. Esto crea un problema de recuperación más difícil porque las críticas pueden expresar conceptos relacionados sin compartir muchas de las mismas palabras clave.
Después de generar incrustaciones para todas las críticas, calculamos la similitud del coseno directamente en el espacio de incrustación. Cada inserción de crítica generada por Sentence Transformer se representa como un vector numérico denso de 384 dimensiones, correspondiente al número de características aprendidas.
La similitud se calcula de dos maneras: (a) entre todas las críticas de los estudiantes y todas las críticas de los expertos, (b) entre las críticas de los estudiantes y un centroide experto. (Tabla 2). Este vector centroide se calcula promediando los componentes correspondientes de todas las incorporaciones de críticas de expertos. Por lo tanto, el centroide resultante también contiene 384 dimensiones. Conceptualmente, este centroide representa el “centro” semántico aproximado de las críticas a nivel de expertos y puede usarse para medir qué tan cerca se alinea la crítica de un estudiante con la escritura de un experto en el espacio de incrustación.
Para comprender el espacio de incrustación, también visualizamos las incrustaciones utilizando PCA (Figura 2). PCA reduce las muchas dimensiones de las incrustaciones a dos dimensiones preservando gran parte de su significado semántico.
La trama de la PCA revela varias relaciones interesantes. La Crítica de Estudiante S1 parece cercana a las Críticas de Expertos E1 y E2. Esto tiene sentido porque discuten ideas similares como la luz, la sombra, el estado de ánimo y el significado dramático.
Student Critique S7 también parece cercano a Expert Critique E3. Ambas críticas discuten el simbolismo, la emoción y el significado más profundo de la pintura. Aunque usan palabras diferentes, expresan ideas similares.
El gráfico PCA también muestra que las críticas de estudiantes y expertos no están separadas en grupos perfectamente aislados. Algunas críticas de estudiantes parecen sorprendentemente cercanas a las críticas de expertos, especialmente cuando discuten conceptos artísticos similares. Al mismo tiempo, las críticas más débiles o más genéricas tienden a parecer más alejadas de la región experta del espacio de incrustación.
Las puntuaciones de semejanza de expertos (Tabla 2) también concuerdan con el gráfico PCA. S1 tiene la puntuación más alta (0,802) y se acerca a las críticas de los expertos E1 y E2. Esto sugiere que S1 es más similar a las críticas de los expertos. S5 (0,765) y S6 (0,75) también tienen puntuaciones bastante altas. En la trama, aparecen cercanos entre sí y algo cercanos a las críticas de los expertos.
S7 tiene una puntuación moderada (0,73), pero parece muy cercana a E3. Ambas críticas discuten el simbolismo, la emoción y un significado más profundo. S4 tiene la puntuación más baja (0,618). En la trama también aparece más alejado de las críticas de los expertos. Esta crítica se centra más en sentimientos personales que en un análisis artístico detallado.
En esta etapa, a pesar del paso de la simple concordancia de palabras clave a la comprensión del significado, las incrustaciones permanecen fijas. La siguiente etapa presenta modelos de transformadores que pueden ajustar su comprensión en función del contexto circundante.
C.4 Método 4: Modelos de transformadores ajustados
La etapa final presenta modelos de transformadores perfeccionados. En el Método 3, utilizamos un transformador de oraciones para comparar críticas basadas en similitud semántica. Aquí, vamos un paso más allá al entrenar el modelo directamente en críticas etiquetadas de expertos y novatos.
Específicamente, ajustamos un modelo DistilBERT previamente entrenado de la biblioteca Hugging Face Transformers. DistilBERT es una versión más pequeña y rápida de BERT. Fue entrenado para aprender muchos de los mismos patrones de lenguaje que el modelo BERT original usando menos parámetros. DistilBERT se creó mediante un proceso conocido como destilación del conocimiento. Aunque es más liviano y fácil de entrenar, aún funciona muy bien en muchas tareas de PNL.
En nuestro Método 4, en lugar de aprender el idioma desde cero, el modelo (DistilBert) comienza con el conocimiento de grandes cantidades de texto y luego se adapta a nuestra tarea de crítica y clasificación. Este proceso se llama aprendizaje por transferencia. Los transformadores también utilizan mecanismos de atención que ayudan al modelo a comprender las relaciones entre las palabras de una oración.
El plan de formación implica:
tokenizar las críticas en entradas compatibles con transformadores ajustar el modelo previamente entrenado en críticas etiquetadas generar probabilidades de clase para cada crítica
Analicemos el fragmento de código del Método 4, que se muestra a continuación.
#Cargar Tokenizer model_checkpoint = "distilbert-base-uncased" tokenizer = AutoTokenizer.from_pretrained( model_checkpoint ) #Tokenize Text def tokenize_function(ejemplo): return tokenizer( ejemplo["text"], truncation=True, padding="max_length", max_length=128 ) tokenized_dataset = dataset.map(tokenize_function)
El tokenizador creado con AutoTokenizer.from_pretrained() se usa dentro de tokenize_function() a través de la línea tokenizer(ejemplo["texto"], …).
En la PNL basada en transformadores, el tokenizador no es simplemente un tokenizador. Realiza varios pasos de preprocesamiento a la vez:
divide el texto en tokens convierte los tokens en ID de tokens numéricos usando el vocabulario del modelo agrega tokens transformadores especiales trunca secuencias largas rellena secuencias más cortas a una longitud fija crea máscaras de atención. La representación numérica resultante es lo que el modelo transformador utiliza posteriormente como entrada para el entrenamiento y la predicción.
El argumento truncation=True garantiza que las críticas muy largas se reduzcan a una longitud máxima. El argumento padding="max_length" rellena las críticas más cortas con ceros para que todas las secuencias de entrada tengan la misma longitud fija (128 tokens). Finalmente, dataset.map(tokenize_function) aplica este proceso de tokenización a cada ejemplo del conjunto de datos, produciendo un conjunto de datos listo para transformar para entrenamiento.
A diferencia del enfoque basado en incrustación del Método 3, este método realiza una clasificación supervisada explícita. Para cada crítica, el modelo predice ambos:
una etiqueta de clase una puntuación de confianza para cada clase
Por ejemplo, considere la siguiente crítica:
"La disposición de las figuras y el uso cuidadoso de las sombras crean tensión psicológica y ambigüedad simbólica en toda la composición".
A primera vista, esta crítica suena relativamente sofisticada porque utiliza un lenguaje artístico avanzado, como por ejemplo:
“tensión psicológica” “ambigüedad simbólica” “composición”
Un método más simple, como TF-IDF, podría recompensar en gran medida estas palabras clave porque aparecen con frecuencia en las críticas de expertos. En otras palabras, TF-IDF observa principalmente que la crítica contiene un vocabulario importante asociado con el análisis del arte.
Sin embargo, el modelo transformador va más allá de palabras clave aisladas. Analiza cómo se conectan las ideas a lo largo de la oración y si la crítica muestra un razonamiento más profundo. Aunque la crítica utiliza términos sofisticados, el análisis es breve y algo general. Analiza la tensión psicológica y el simbolismo, pero no los explica con mucho detalle. En comparación con las críticas de los expertos, el razonamiento está menos desarrollado.
Después de realizar ajustes durante 100 épocas, el transformador clasificó correctamente la crítica como de novato:
Etiqueta prevista: 0 Confianza: 0,685 Probabilidad similar a la de un novato: 0,685 Probabilidad similar a la de un experto: 0,315
Es interesante observar que, cuando el modelo fue entrenado durante solo 30 épocas, la misma crítica se clasificó como de experto. Esto sugiere que en una etapa anterior del entrenamiento, el modelo puede haber dependido más de un vocabulario sofisticado. La capacitación adicional le ayudó a poner mayor énfasis en patrones contextuales y analíticos más amplios en lugar de palabras clave únicamente.
Es importante tener en cuenta uno de los principales desafíos del ajuste fino de los transformadores: los transformadores suelen requerir grandes cantidades de datos de entrenamiento. Nuestro conjunto de datos educativos contiene solo una pequeña cantidad de críticas. Debido a que los modelos de transformadores contienen millones de parámetros entrenables, generalmente necesitan conjuntos de datos mucho más grandes para generalizar de manera confiable.
A medida que el entrenamiento continúa durante muchas épocas, el modelo adquiere cada vez más confianza en sus predicciones. Sin embargo, con un conjunto de datos pequeño, parte de esta confianza puede reflejar la memorización de patrones estilísticos observados durante el entrenamiento en lugar de una comprensión genuina del lenguaje. Este fenómeno se conoce como sobreajuste y es especialmente común cuando los modelos de transformadores grandes se entrenan con datos limitados.
Este ejemplo destaca tanto las fortalezas como las limitaciones de los modelos de transformadores. Pueden captar significados más allá de la simple concordancia de palabras clave, pero también pueden volverse demasiado confiados cuando los datos de entrenamiento son escasos.
Esta etapa final completa la progresión desde:
puntuación heurística transparente aprendizaje automático clásico incorporaciones semánticas comprensión del lenguaje basada en transformadores contextuales
Juntos, estos cuatro métodos ilustran la evolución más amplia de la búsqueda semántica y la PNL moderna: desde características diseñadas manualmente hacia representaciones aprendidas de significado y contexto cada vez más sofisticadas.
D. Discusión
Los cuatro métodos de este artículo muestran cómo la búsqueda semántica ha evolucionado desde la simple coincidencia de palabras clave hasta la comprensión del lenguaje contextual.
El primer método, TF-IDF con puntuación basada en reglas, fue simple y altamente interpretable. Podríamos ver fácilmente por qué una crítica obtuvo una clasificación más alta que otra. Sin embargo, el método dependía en gran medida del uso exacto de las palabras y a menudo omitía el significado más profundo.
El segundo método utilizó regresión logística en funciones TF-IDF. En lugar de definir reglas manualmente, el modelo aprendió patrones a partir de críticas etiquetadas. Al examinar los coeficientes aprendidos, podemos ver qué palabras son más comunes en las críticas de expertos y cuáles son más comunes en las críticas de novatos. La regresión logística aprende estos patrones de los vectores de palabras TF-IDF. Como comentamos, el modelo no comprende realmente el contexto ni el significado. A pesar de eso, aún puede funcionar sorprendentemente bien cuando ciertas palabras o frases se correlacionan fuertemente con estilos de escritura particulares.
El tercer método introdujo incrustaciones a través de Sentence Transformers. Este fue un cambio importante porque ahora las críticas podían compararse basándose en el significado semántico en lugar del vocabulario exacto. Las críticas que discutían ideas artísticas similares a menudo aparecían muy juntas en el espacio de incrustación, incluso cuando se utilizaba una redacción diferente.
Una observación importante del Método 3 fue que la calidad de la crítica no siempre es clara. Algunas críticas de estudiantes parecían semánticamente cercanas a las críticas de expertos a pesar de ser etiquetadas como de novatos. En este método, Sentence Transformer actúa principalmente como un modelo de incrustación semántica previamente entrenado. No reentrenamos el transformador en sí. En cambio, cada crítica se convierte en un vector semántico denso y la similitud se mide utilizando la similitud del coseno en el espacio de incrustación.
Finalmente, en el Método 4, presentamos el modelo de transformador ajustado. Este modelo introdujo la comprensión del lenguaje contextual a través de DistilBERT. Tanto el Método 2 como el Método 4 son enfoques de aprendizaje supervisado porque aprenden de ejemplos etiquetados. Sin embargo, aprenden de manera muy diferente. La regresión logística opera con características fijas de TF-IDF, calculadas a partir de frecuencias de palabras y frases. Por otro lado, los transformadores aprenden representaciones contextuales analizando las relaciones entre palabras, estructura de oraciones y significado.
Una distinción importante es que, aunque tanto el Método 3 como el Método 4 utilizan arquitecturas de transformadores, las utilizan de diferentes maneras. En el Método 3, el transformador se utiliza principalmente como un generador de incrustación previamente entrenado para lograr similitud semántica. En el Método 4, el transformador en sí se ajusta directamente en el conjunto de datos críticos etiquetados. Durante el entrenamiento, el modelo actualiza sus pesos internos para aprender a distinguir las críticas de expertos de las críticas de novatos. En lugar de servir principalmente como extractor de características, el transformador mismo se convierte en clasificador. Esto representa un cambio conceptual importante desde la comparación de similitudes semánticas hasta el aprendizaje supervisado de tareas específicas.
Los experimentos también mostraron uno de los principales desafíos del ajuste fino de los transformadores: el hecho de que los modelos grandes suelen necesitar muchos más datos de entrenamiento. Cuando el conjunto de datos es pequeño, el modelo puede memorizar los ejemplos de entrenamiento con demasiada precisión y es posible que no pueda generalizar bien a datos nuevos.
En general, discutimos los diversos métodos de manera progresiva, lo que muestra que los diferentes modelos de PNL representan el significado de diferentes maneras. Específicamente, TF-IDF se centra principalmente en palabras importantes, los modelos de incrustación se centran en la similitud semántica y los transformadores intentan comprender el lenguaje a través del contexto y las relaciones entre palabras.
E. Conclusión
En este artículo, exploramos cuatro enfoques prácticos para la búsqueda semántica, pasando de la recuperación clásica TF-IDF a los modelos transformadores modernos. Utilizando el ejemplo de críticas de pintura de estudiantes y expertos, examinamos cómo los diferentes métodos de PNL representan el lenguaje y miden la similitud.
Los experimentos demostraron que cada método tiene ventajas y limitaciones. Los métodos clásicos siguen siendo simples, rápidos e interpretables. Los modelos integrados capturan la similitud semántica de manera efectiva incluso con conjuntos de datos más pequeños. Los transformadores brindan una comprensión contextual más profunda, pero generalmente requieren más datos etiquetados para generalizar de manera confiable.
Una de las observaciones más importantes fue que la comprensión semántica existe en un continuo. Algunas críticas de estudiantes fueron similares a las críticas de expertos, incluso si no eran completamente de nivel experto.
Los sistemas modernos de PNL están mejorando en la comprensión del significado, el contexto y las relaciones entre ideas. Sin embargo, el objetivo principal sigue siendo el mismo: ayudar a las máquinas a comprender mejor el lenguaje humano.
El código de los métodos descritos anteriormente se puede encontrar en:
https://github.com/theomitsa/Semantic-Search-Evolution
Los datos sintéticos (críticas) se pueden encontrar dentro del código.
Nota: Todas las figuras y argumentos fueron creados por el autor.
¡Gracias por leer!