Cómo las métricas (y las LLM) pueden engañarlo: una guía de campo para las paradojas

Descripción general

Solo ilusiones ópticas o rompecabezas alucinantes. También pueden ser lógicos, lo que hace que las observaciones iniciales se desmoronen en una investigación más cercana. En la ciencia de datos, las paradojas surgen cuando tomamos números al pie de la letra, sin investigar el contexto detrás de ellas. Uno puede tener las imágenes más nítidas y aún así alejarse con la historia equivocada.

En este artículo, discutimos tres paradojas lógicas que sirven como cuentos de advertencia para cualquier persona que interpreta los datos demasiado rápido, sin aplicar el contexto. Exploramos cómo surgen las paradojas en los casos de uso de la ciencia de datos y la inteligencia empresarial (BI) y luego ampliamos las ideas a los sistemas de generación (RAG) de recuperación (RAG), donde las paradojas similares pueden socavar la calidad de la solicitud proporcionada como la producción del modelo.

Paradoja de Simpson en Inteligencia de Negocios

La paradoja de Simpson describe el escenario en el que las tendencias se retiran cuando los datos se agregan. En otras palabras, las tendencias que observa en subgrupos se voltean cuando combina los números y los analiza. Supongamos que estamos analizando las ventas de cuatro ubicaciones de una popular cadena de helados. Cuando las ventas para cada ubicación se analizan individualmente, sugiere que el sabor de chocolate es el más preferido entre los clientes. Pero cuando se suman las ventas, la tendencia desaparece y los nuevos resultados combinados sugieren que la vainilla es más preferida. Esta inversión de tendencia se denota por la paradoja de Simpson. Utilizamos los datos ficticios a continuación para demostrar esto.

Ubicación Chocolate Vainilla Total de clientes Chocolate % Vanilla % Ganador
Suburbio 15 5 20 75.0% 25.0% Chocolate
Ciudad B 33 27 60 55.0% 45.0% Chocolate
Centro comercial 2080 1920 4000 52.0% 48.0% Chocolate
Aeropuerto 1440 2160 3600 40.0% 60.0% Vainilla
Total 3568 4112 7680 46.5% 53.5% Vainilla!
Ventas por ubicación de la tienda para una cadena de helados ficticia (por el autor)

A continuación se muestra una ilustración visual.

La paradoja de Simpson en BI Reporting – Ilustration (Imagen del autor)

Un analista de datos que pasa por alto estas dinámicas de subgrupos puede suponer que el chocolate tiene un rendimiento inferior. Por lo tanto, es esencial agregar números mediante subgrupos y verificar la presencia de la paradoja de Simpson. Cuando se produce una reversión en la tendencia, la variable de acecho debe identificarse como el siguiente paso. Una variable al acecho es el factor oculto que influye en los resultados del grupo. En este caso, la ubicación de la tienda es la variable al acecho. Se necesita una comprensión contextual profunda para interpretar por qué la venta de helados de vainilla era alta en el aeropuerto, volteando el resultado general. Algunas preguntas que podrían usarse para investigar son:

• ¿Las enchufes del aeropuerto almacenan menos opciones de chocolate?

• ¿Los viajeros prefieren los sabores más suaves?

• ¿Hubo una campaña promocional favoreciendo vainilla en las tiendas en el aeropuerto?

Paradoja de Simpson en sistemas de trapo

Supongamos que tiene un modelo de trapo (generación de recuperación de la recuperación) que mide el sentimiento público hacia los vehículos eléctricos (EV) y responde preguntas alrededor de la misma. El modelo utiliza artículos de noticias de 2010 a 2024. Hasta 2016, los EV recibían opiniones mixtas debido a su rango limitado, un mayor precio de compra y falta de estaciones de carga. Todos estos factores hicieron imposible conducir en EV por largas distancias. Los informes de los periódicos antes de 2017 solían resaltar tales deficiencias. Pero a partir de 2017, los EV comenzaron a ser percibidos de manera buena debido a mejoras en el rendimiento y la disponibilidad de estaciones de carga. Este cambio en la percepción ocurrió particularmente después del exitoso lanzamiento del EV premium de Tesla. Un modelo de trapo que utiliza informes de noticias de 2010 a 2024 probablemente daría respuestas contradictorias a preguntas similares, lo que desencadenará la paradoja de Simpson.

Como ejemplo, si se le pregunta al trapo: “¿La adopción EV en los Estados Unidos sigue siendo baja?”, La respuesta podría ser “Sí, la adopción sigue siendo baja debido a los altos costos de compra e infraestructura limitada”. Si se le pregunta al trapo: “¿Ha aumentado recientemente la adopción de EV en los Estados Unidos?”, La respuesta sería “sí, la adopción ha aumentado enormemente debido a los avances en la tecnología y la infraestructura de carga”. En este caso, la variable al acecho es la fecha de publicación. Una solución práctica para este tema es etiquetar los documentos (artículos) en contenedores basados en el tiempo durante la fase de preprocesamiento. Otras opciones incluyen alentar a los usuarios a especificar un rango de tiempo en su aviso (por ejemplo, en los últimos cinco años, ¿cómo ha sido la adopción de EV?) O ajustar la LLM para establecer explícitamente la línea de tiempo que está considerando su respuesta (por ejemplo, alrededor de 2024, la adopción de EV ha aumentado mucho).

Paradoja de Simpson en sistemas RAG (imagen del autor)

Paradoja de precisión en problemas de ciencia de datos

El quid de la paradoja de la precisión es que la alta precisión no es indicativa de una salida útil. Supongamos que está construyendo un modelo de clasificación para identificar si un paciente tiene una enfermedad rara que afecta solo a 1 de cada 100. El modelo identifica y etiqueta correctamente a aquellos que no tienen la enfermedad y, por lo tanto, logra una precisión del 99%. Sin embargo, no identifica a la única persona que tiene la enfermedad y necesita atención médica urgente. De este modo, el modelo se vuelve inútil para detectar la enfermedad, que es su propio propósito. Esto ocurre especialmente en conjuntos de datos desequilibrados donde las observaciones para una clase son mínimas. Esto se ha ilustrado en la figura a continuación.

Paradoja de precisión en problemas de ciencia de datos (imagen del autor)

La mejor manera de abordar la paradoja de precisión es usar métricas que capturan el rendimiento de las clases minoritarias, como precisión, retiro y puntaje F1. Otro enfoque a seguir es tratar los conjuntos de datos desequilibrados como problemas de detección de anomalías, en comparación con los problemas de clasificación. También se podría considerar recopilar más datos de clase minoritarios (si es posible), exhibir demasiado la clase minoritaria o submuestrar la clase mayoritaria. A continuación se muestra una guía rápida que ayuda a determinar qué métrica usar según el caso de uso, el objetivo y las consecuencias de los errores.

Elegir la métrica adecuada para la medición de rendimiento de su modelo (imagen del autor)

Paradoja de precisión en LLM

Si bien la paradoja de precisión es un problema común que abordan muchos científicos de datos, sus implicaciones en LLM se ignoran en gran medida. La métrica de precisión puede superarse peligrosamente en los casos de uso que implican seguridad, detección de toxicidad y mitigación de sesgo. Una alta precisión no significa que un modelo sea justo y seguro de usar. Por ejemplo, un modelo LLM que tiene una precisión del 98% no sirve de nada si clasifica erróneamente 2 indicaciones maliciosas como seguras e inofensivas. Por lo tanto, en las evaluaciones de LLM, es una buena idea usar el recuerdo, la precisión o el PR-AUC sobre la precisión, ya que indican qué tan bien el modelo aborda las clases minoritarias.

Ley de Goodhart en inteligencia empresarial

El economista Charles Goodhart declaró que “Cuando una medida se convierte en un objetivo, deja de ser una buena medida”. Esta ley es un recordatorio suave de que si optimiza demasiado una métrica sin comprender las implicaciones y el contexto, el modelo será contraproducente.

Un gerente de una agencia de noticias ficticia en línea establece un KPI para su equipo. Le pide al equipo que trabaje para aumentar la duración de la sesión en un 20%. El equipo extiende las presentaciones artificialmente y también agrega contenido de relleno para aumentar la duración de la sesión. La duración de la sesión aumenta, pero la calidad del video se pierde y, como resultado, el valor que obtienen los usuarios del video disminuyen.

Otro ejemplo está relacionado con la rotación del cliente. En un intento por reducir la rotación de clientes, una aplicación de entretenimiento basada en suscripción decide colocar el botón ‘Under suscripción’ en una ubicación difícil de encontrar en su portal web. Como resultado, la rotación del cliente se reduce, pero no se debe a una mejor satisfacción del cliente. Se debe únicamente a las opciones de salida limitadas, una ilusión de retención de clientes. A continuación se muestra una ilustración visual que demuestra cómo los esfuerzos para cumplir o superar los objetivos de crecimiento (como aumentar la duración de la sesión o la participación del usuario) a menudo pueden conducir a consecuencias no deseadas, lo que lleva a una disminución en la experiencia del usuario. Cuando los equipos recurren a tácticas de inflación artificiales para ayudar a aumentar las métricas de rendimiento, la mejora métrica se ve bien en el papel, pero no son significativos de ninguna manera.

La Ley de Goodhart – Ilustración (Imagen del autor)

La ley de Goodhart en LLMS

Cuando entrena demasiado un LLM en un conjunto de datos particular (especialmente un punto de referencia), puede comenzar a memorizar patrones de esos datos de entrenamiento en lugar de aprender a generalizar. Este es un ejemplo clásico de sobreajuste, donde el modelo funciona extremadamente bien en esos datos de entrenamiento, pero funciona mal en las entradas del mundo real.

Supongamos que está entrenando una LLM para resumir los artículos de noticias. Utiliza la métrica Rouge (suplente orientado al retiro para la evaluación de la protección) para evaluar el rendimiento de la LLM. La métrica Rouge recompensa coincidencias exactas o casi exactas de N-Grams con los resúmenes de referencia. Con el tiempo, el LLM comienza a copiar grandes frases de texto de los artículos de entrada para obtener un aumento en la puntuación de Rouge. También usa palabras de moda que aparecen mucho en resúmenes de referencia. Supongamos que el artículo de entrada tiene el texto “el banco aumentó las tasas de interés para frenar la inflación, y esto hizo que los precios de las acciones disminuyan bruscamente”. El modelo de sobrefago lo resumiría como “el banco aumentó las tasas de interés para frenar la inflación”, mientras que un modelo de generalización lo resumiría como “el aumento de las tasas de interés provocó una disminución en los mercados de valores”. La siguiente ilustración demuestra cómo optimizar demasiado su modelo para una métrica de evaluación puede dar lugar a respuestas de baja calidad (respuestas que son buenas en el papel pero no son útiles).

Goodhart’s Law en LLMS (imagen del autor)

Observaciones finales

Ya sea en Business Intelligence o LLMS, las paradojas pueden arrastrarse si los números y las métricas se manejan sin los matices y el contexto subyacentes. Además, es importante recordar que el exceso de ajuste puede dañar el panorama general. La combinación del análisis cuantitativo con la visión humana es crucial para evitar tales dificultades y crear informes confiables y poderosos LLM que realmente entreguen valor.