En este artículo, aprenderá a evaluar modelos de lenguaje grandes utilizando métricas prácticas, puntos de referencia confiables y flujos de trabajo repetibles que equilibran calidad, seguridad y costo.
Los temas que cubriremos incluyen:
Métricas de calidad y similitud del texto que puede automatizar para realizar comprobaciones rápidas. Cuándo utilizar puntos de referencia, revisión humana, LLM como juez y verificadores. Pruebas de seguridad/sesgo y evaluaciones a nivel de proceso (razonamiento).
Vayamos directo al grano.
Todo lo que necesita saber sobre las métricas de evaluación de LLM
Imagen por autor
Introducción
Cuando aparecieron por primera vez los grandes modelos de lenguaje, la mayoría de nosotros simplemente estábamos pensando en lo que podrían hacer, qué problemas podrían resolver y hasta dónde podrían llegar. Pero últimamente, el espacio se ha visto inundado con toneladas de modelos de código abierto y de código cerrado, y ahora la verdadera pregunta es: ¿cómo sabemos cuáles son realmente buenos? La evaluación de grandes modelos de lenguaje se ha convertido silenciosamente en uno de los problemas más complicados (y sorprendentemente complejos) de la inteligencia artificial. Realmente necesitamos medir su desempeño para asegurarnos de que realmente hagan lo que queremos y para ver qué tan preciso, factual, eficiente y seguro es realmente un modelo. Estas métricas también son muy útiles para que los desarrolladores analicen el rendimiento de su modelo, lo comparen con otros y detecten sesgos, errores u otros problemas. Además, dan una mejor idea de qué técnicas funcionan y cuáles no. En este artículo, analizaré las principales formas de evaluar modelos de lenguaje grandes, las métricas que realmente importan y las herramientas que ayudan a los investigadores y desarrolladores a realizar evaluaciones que signifiquen algo.
Métricas de calidad y similitud del texto
Evaluar modelos de lenguaje grandes a menudo significa medir en qué medida el texto generado coincide con las expectativas humanas. Para tareas como traducción, resúmenes o paráfrasis, las métricas de calidad y similitud del texto se utilizan mucho porque proporcionan una forma cuantitativa de comprobar el resultado sin necesidad de que siempre sean humanos los que lo juzguen. Por ejemplo:
BLEU compara n-gramas superpuestos entre la salida del modelo y el texto de referencia. Es muy utilizado para tareas de traducción. ROUGE-L se centra en la subsecuencia común más larga, capturando la superposición general de contenido, especialmente útil para resumir. METEOR mejora la coincidencia a nivel de palabras al considerar sinónimos y derivaciones, haciéndolo más consciente semánticamente. BERTScore utiliza incrustaciones contextuales para calcular la similitud de coseno entre oraciones generadas y de referencia, lo que ayuda a detectar paráfrasis y similitud semántica.
Para tareas de clasificación o respuesta a preguntas objetivas, se utilizan métricas a nivel de token como Precisión, Recuperación y F1 para mostrar la corrección y la cobertura. La perplejidad (PPL) mide qué tan “sorprendido” está un modelo por una secuencia de tokens, lo que funciona como un indicador de fluidez y coherencia. Una menor perplejidad suele significar que el texto es más natural. La mayoría de estas métricas se pueden calcular automáticamente utilizando bibliotecas de Python como nltk, evalua o sacrebleu.
Puntos de referencia automatizados
Una de las formas más sencillas de comprobar modelos de lenguaje grandes es mediante el uso de puntos de referencia automatizados. Suelen ser conjuntos de datos grandes y cuidadosamente diseñados con preguntas y respuestas esperadas, lo que nos permite medir el rendimiento cuantitativamente. Algunos populares son MMLU (Massive Multitask Language Understanding), que cubre 57 temas desde ciencias hasta humanidades, GSM8K, que se centra en problemas matemáticos con mucho razonamiento, y otros conjuntos de datos como ARC, TruthfulQA y HellaSwag, que prueban el razonamiento, la factualidad y el conocimiento de sentido común de un dominio específico. Los modelos a menudo se evalúan utilizando la precisión, que es básicamente el número de respuestas correctas dividido por el total de preguntas:
Precisión = Respuestas correctas / Total de preguntas
Exactitud = Correcto Respuestas / Total Preguntas
Para una visión más detallada, también se puede utilizar la puntuación de probabilidad logarítmica. Mide la confianza que tiene un modelo en las respuestas correctas. Los puntos de referencia automatizados son excelentes porque son objetivos, reproducibles y buenos para comparar múltiples modelos, especialmente en tareas estructuradas o de opción múltiple. Pero también tienen sus desventajas. Los modelos pueden memorizar las preguntas de referencia, lo que puede hacer que las puntuaciones parezcan mejores de lo que realmente son. A menudo tampoco capturan la generalización o el razonamiento profundo, y no son muy útiles para resultados abiertos. También puede utilizar algunas herramientas y plataformas automatizadas para esto.
Evaluación humana en el circuito
Para tareas abiertas como resúmenes, redacción de historias o chatbots, las métricas automatizadas a menudo pasan por alto los detalles más finos de significado, tono y relevancia. Ahí es donde entra en juego la evaluación humana. Implica que anotadores o usuarios reales lean los resultados del modelo y los califiquen según criterios específicos como utilidad, claridad, precisión e integridad. Algunos sistemas van más allá: por ejemplo, Chatbot Arena (LMSYS) permite a los usuarios interactuar con dos modelos anónimos y elegir cuál prefieren. Estas elecciones se utilizan luego para calcular una puntuación de estilo Elo, similar a cómo se clasifican los jugadores de ajedrez, dando una idea de qué modelos se prefieren en general.
La principal ventaja de la evaluación humana es que muestra lo que prefieren los usuarios reales y funciona bien para tareas creativas o subjetivas. Las desventajas son que es más caro, más lento y puede ser subjetivo, por lo que los resultados pueden variar y requieren rúbricas claras y una formación adecuada para los anotadores. Es útil para evaluar cualquier modelo de lenguaje grande diseñado para la interacción del usuario porque mide directamente lo que las personas encuentran útil o efectivo.
Evaluación de LLM como juez
Una forma más nueva de evaluar modelos de lenguaje es hacer que un modelo de lenguaje grande juzgue a otro. En lugar de depender de revisores humanos, se puede solicitar a un modelo de alta calidad como GPT-4, Claude 3.5 o Qwen que califique los resultados automáticamente. Por ejemplo, podría darle una pregunta, el resultado de otro modelo de lenguaje grande y la respuesta de referencia, y pedirle que califique el resultado en una escala del 1 al 10 en cuanto a corrección, claridad y precisión objetiva.
Este método permite realizar evaluaciones a gran escala de forma rápida y a bajo costo, y al mismo tiempo obtener puntuaciones consistentes basadas en una rúbrica. Funciona bien para tablas de clasificación, pruebas A/B o para comparar varios modelos. Pero no es perfecto. La evaluación del modelo de lenguaje grande puede tener sesgos, favoreciendo a veces resultados similares a su propio estilo. También puede carecer de transparencia, lo que dificulta saber por qué otorgó una determinada puntuación, y puede tener dificultades con tareas muy técnicas o de dominios específicos. Las herramientas populares para hacer esto incluyen OpenAI Evals, Evalchemy y Ollama para comparaciones locales. Esto permite a los equipos automatizar gran parte de la evaluación sin necesidad de humanos para cada prueba.
Verificadores y controles simbólicos
Para tareas en las que hay una respuesta clara, correcta o incorrecta, como problemas matemáticos, codificación o razonamiento lógico, los verificadores son una de las formas más confiables de verificar los resultados del modelo. En lugar de mirar el texto en sí, los verificadores simplemente verifican si el resultado es correcto. Por ejemplo, el código generado se puede ejecutar para ver si proporciona el resultado esperado, los números se pueden comparar con los valores correctos o se pueden usar solucionadores simbólicos para asegurarse de que las ecuaciones sean consistentes.
Las ventajas de este enfoque son que es objetivo, reproducible y no está sesgado por el estilo o el lenguaje de escritura, lo que lo hace perfecto para tareas de código, matemáticas y lógica. La desventaja es que los verificadores solo trabajan para tareas estructuradas, analizar los resultados del modelo a veces puede ser complicado y realmente no pueden juzgar la calidad de las explicaciones o el razonamiento. Algunas herramientas comunes para esto incluyen evalplus y Ragas (para verificaciones de generación aumentada con recuperación), que le permiten automatizar verificaciones confiables para resultados estructurados.
Seguridad, sesgo y evaluación ética
Verificar un modelo de lenguaje no se trata solo de precisión o fluidez: la seguridad, la equidad y el comportamiento ético son igualmente importantes. Existen varios puntos de referencia y métodos para probar estas cosas. Por ejemplo, BBQ mide la equidad demográfica y los posibles sesgos en los resultados del modelo, mientras que RealToxicityPrompts comprueba si un modelo produce contenido ofensivo o inseguro. Otros marcos y enfoques analizan las terminaciones dañinas, la desinformación o los intentos de eludir las reglas (como el jailbreak). Estas evaluaciones generalmente combinan clasificadores automatizados, jueces basados en modelos de lenguaje de gran tamaño y algunas auditorías manuales para obtener una imagen más completa del comportamiento del modelo.
Las herramientas y técnicas populares para este tipo de pruebas incluyen las herramientas de evaluación Hugging Face y el marco de IA constitucional de Anthropic, que ayudan a los equipos a verificar sistemáticamente si hay sesgos, resultados dañinos y cumplimiento ético. Realizar una evaluación ética y de seguridad ayuda a garantizar que los grandes modelos lingüísticos no solo sean capaces, sino también responsables y dignos de confianza en el mundo real.
Evaluaciones basadas en razonamiento y procesos
Algunas formas de evaluar modelos lingüísticos grandes no se centran únicamente en la respuesta final, sino también en cómo llegó allí el modelo. Esto es especialmente útil para tareas que necesitan planificación, resolución de problemas o razonamiento de varios pasos, como sistemas RAG, solucionadores matemáticos o modelos de lenguajes grandes agentes. Un ejemplo son los modelos de recompensa de procesos (PRM), que verifican la calidad de la cadena de pensamiento de un modelo. Otro enfoque es la corrección paso a paso, donde se revisa cada paso del razonamiento para ver si es válido. Las métricas de fidelidad van aún más allá al verificar si el razonamiento realmente coincide con la respuesta final, asegurando que la lógica del modelo sea sólida.
Estos métodos brindan una comprensión más profunda de las habilidades de razonamiento de un modelo y pueden ayudar a detectar errores en el proceso de pensamiento en lugar de solo en el resultado. Algunas herramientas comúnmente utilizadas para el razonamiento y la evaluación de procesos incluyen evaluaciones basadas en PRM, Ragas para verificaciones específicas de RAG y ChainEval, que ayudan a medir la calidad y la coherencia del razonamiento a escala.
Resumen
Esto nos lleva al final de nuestra discusión. Resumamos todo lo que hemos cubierto hasta ahora en una sola tabla. De esta manera, tendrá una referencia rápida que podrá guardar o consultar cuando trabaje con una evaluación de modelos de lenguaje grandes.
Categoría Ejemplo Métricas Ventajas Contras Mejor uso Puntos de referencia Precisión, LogProb Objetivo, estándar Puede estar desactualizado Capacidad general HITL Elo, calificaciones Perspectiva humana Costoso, lento Tareas conversacionales o creativas LLM como juez Puntaje de rúbrica Escalable Riesgo de sesgo Evaluación rápida y pruebas A/B Verificadores Verificaciones de código/matemáticas Objetivo Dominio limitado Tareas de razonamiento técnico PRM basado en razonamiento, ChainEval Conocimiento del proceso Configuración compleja Modelos agentes, razonamiento de varios pasos Calidad del texto BLEU, ROUGE Fácil de automatizar Pasa por alto la semántica de las tareas NLG Safety/Bias BBQ, SafeBench Esencial para la ética Difícil de cuantificar Cumplimiento e IA responsable