De la lógica a la confusión: los investigadores del MIT muestran cómo los ajustes rápidos simples descarrilan el razonamiento de LLM

Los modelos de idiomas grandes se utilizan cada vez más para resolver problemas matemáticos que imitan las tareas de razonamiento del mundo real. Estos modelos se prueban su capacidad para responder consultas objetivas y qué tan bien pueden manejar procesos lógicos de varios pasos. La resolución matemática de problemas ofrece una forma confiable de examinar si los modelos pueden extraer la información necesaria, navegar declaraciones complejas y calcular las respuestas correctamente. Este campo se ha vuelto central para comprender el alcance de las capacidades lógicas y cognitivas de la IA.

Una preocupación clave en este dominio es cómo funcionan estos modelos cuando sus entradas no son ordenadas o formateadas. En muchos casos, las preguntas que se encuentran en la práctica vienen con información de fondo adicional, detalles irrelevantes o incluso sugerencias sutiles que podrían llevarlas fuera de pista. Si bien los modelos pueden funcionar bien en los problemas de referencia estándar, su capacidad para aislar información importante de las indicaciones desordenadas sigue siendo cuestionable. Esto ha planteado la necesidad de examinar cómo las distracciones influyen en su razonamiento y si los modelos actuales están listos para casos de uso impredecibles del mundo real.

Herramientas y puntos de referencia pasados ​​se han centrado principalmente en conjuntos de problemas bien formados, como GSM8K o Matemáticas. Aún así, las variantes más nuevas como GSM-Symbolic y GSM-Plus comenzaron a probar el rendimiento del modelo bajo variaciones simbólicas e inserciones de distractores. Estas herramientas descubrieron debilidades significativas en LLM cuando se enfrentan a pequeños cambios en el texto del problema. Por ejemplo, la introducción de una cláusula que parece relevante pero lógicamente redundante puede reducir la precisión del modelo hasta en un 65%. Esto llevó a la conclusión de que los modelos a menudo dependen de patrones de superficie en lugar del razonamiento genuino, lo que provocó una mayor exploración en condiciones de prueba más realistas y ruidosas.

Un equipo de investigadores del Instituto de Tecnología de Massachusetts ha introducido una investigación centrada en medir cómo los LLM manejan cuatro tipos de perturbaciones sistemáticas: contexto irrelevante, instrucciones patológicas, información relevante pero no esencial y una combinación de los dos últimos. El equipo evaluó 13 modelos de idiomas grandes, tanto de código abierto como comerciales, a través de las API proporcionadas por OpenAi, Anthrope, Cohere y Tesai. En lugar de confiar en conjuntos de pruebas completas, el equipo probó 56 puntos de datos del conjunto de datos GSM8K por experimento, asegurando que capturaron una distribución equilibrada de la complejidad del razonamiento.

Para construir estas indicaciones alteradas, los investigadores agregaron contextos densos e irrelevantes como las páginas de Wikipedia o los informes financieros en el aporte. Esto tomó hasta el 90% de la ventana de contexto del modelo. En el escenario patológico, se agregaron instrucciones engañosas, diseñadas para manipular la ruta de razonamiento sin alterar la pregunta original. Se insertaron nuevos detalles que eran objetivos correctos pero innecesarios para el caso de contexto relevante para ver cómo los modelos manejaban las distracciones que parecían informativas. En la variante final, se combinaron perturbaciones patológicas y relevantes, aumentando la complejidad de la entrada mientras observaba cómo esta doble presión influyó en la salida del modelo.

El rendimiento cayó más bruscamente cuando se introdujo el contexto irrelevante. En todos los modelos, la precisión promedio disminuyó en un 55.89%. Las instrucciones patológicas causaron una disminución del 8,52%, mientras que el contexto relevante condujo a una disminución del 7,01%. La combinación de los dos tipos de perturbaciones produjo una caída del 12.91% en precisión. Curiosamente, el rendimiento no se correlacionó con el tamaño del modelo: modelos principales como mixtral-8x22b y command-r-plus experimentaron mayores regresiones en comparación con algunos modelos más pequeños. Además, el número de pasos de razonamiento en un problema no afectó significativamente el resultado, lo que sugiere que la complejidad en la estructura lógica no era el factor dominante en la varianza de rendimiento.

Este estudio muestra que los modelos actuales de idiomas grandes, incluso aquellos con miles de millones de parámetros, aún luchan cuando sus indicaciones se alteran relativamente simplemente. Los investigadores del MIT demuestran que la resiliencia del modelo no mejora significativamente con el tamaño y que la capacidad de filtrar y priorizar la información es una brecha importante en el diseño de LLM. Estos hallazgos presionan para desarrollar modelos que estén mejor equipados para lidiar con entradas abarrotadas y engañosas, un paso esencial para acercarse a la IA confiable en entornos del mundo real.


Aquí está el Papel. Además, no olvides seguirnos Gorjeo y únete a nuestro Canal de telegrama y LinkedIn GRsalpicar. No olvides unirte a nuestro 90k+ ml de subreddit.

🔥 [Register Now] Conferencia virtual de Minicon sobre AI agente: registro gratuito + Certificado de asistencia + Evento corto de 4 horas (21 de mayo, 9 am- 1 pm PST) + Hands on Workshop


Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.