Rendimiento del modelo de lenguaje grande en el análisis de series temporales |  de Aparna Dhinakaran |  mayo, 2024
Imagen creada por el autor usando Dall-E 3

¿Cómo se comparan los principales LLM en la detección de anomalías o movimientos en los datos cuando se les proporciona un gran conjunto de datos de series temporales dentro de la ventana contextual?

Si bien los LLM destacan claramente en tareas de procesamiento del lenguaje natural, su capacidad para analizar patrones en datos no textuales, como datos de series temporales, sigue siendo menos explorada. A medida que más equipos se apresuran a implementar soluciones basadas en LLM sin probar exhaustivamente sus capacidades en el análisis de patrones básicos, la tarea de evaluar el desempeño de estos modelos en este contexto adquiere una importancia creciente.

En esta investigación, nos propusimos investigar la siguiente pregunta: dado un gran conjunto de datos de series de tiempo dentro de la ventana de contexto, ¿qué tan bien pueden los LLM detectar anomalías o movimientos en los datos? En otras palabras, ¿debería confiar su dinero a un agente de selección de acciones OpenAI GPT-4 o Anthropic Claude 3? Para responder a esta pregunta, realizamos una serie de experimentos que compararon el desempeño de los LLM en la detección de patrones de series temporales anómalas.

Todo el código necesario para reproducir estos resultados se puede encontrar en este repositorio de GitHub.

Figura 1: Un esbozo de los datos de la serie temporal (imagen del autor)

Le asignamos a GPT-4 y Claude 3 la tarea de analizar los cambios en los puntos de datos a lo largo del tiempo. Los datos que utilizamos representaron métricas específicas para diferentes ciudades del mundo a lo largo del tiempo y se formatearon en JSON antes de ingresarlos en los modelos. Introdujimos ruido aleatorio, que oscila entre el 20% y el 30% del rango de datos, para simular escenarios del mundo real. Los LLM tenían la tarea de detectar estos movimientos por encima de un umbral porcentual específico e identificar la ciudad y la fecha donde se detectó la anomalía. Los datos se incluyeron en esta plantilla de aviso:

  basic template = ''' You are an AI assistant for a data scientist. You have been given a time series dataset to analyze.
The dataset contains a series of measurements taken at regular intervals over a period of time.
There is one timeseries for each city in the dataset. Your task is to identify anomalies in the data. The dataset is in the form of a JSON object, with the date as the key and the measurement as the value.

The dataset is as follows:
{timeseries_data}

Please use the following directions to analyze the data:
{directions}

...

Figura 2: La plantilla de aviso básica utilizada en nuestras pruebas

Analizar patrones en toda la ventana de contexto, detectar anomalías en un gran conjunto de series temporales simultáneamente, sintetizar los resultados y agruparlos por fecha no es una tarea sencilla para un LLM; Realmente queríamos superar los límites de estos modelos en esta prueba. Además, se requirió que los modelos realizaran cálculos matemáticos en la serie temporal, una tarea con la que los modelos de lenguaje generalmente tienen dificultades.

También evaluamos el rendimiento de los modelos bajo diferentes condiciones, como extender la duración de la anomalía, aumentar el porcentaje de la anomalía y variar la cantidad de eventos de anomalía dentro del conjunto de datos. Debemos tener en cuenta que durante nuestras pruebas iniciales, encontramos un problema en el que la sincronización de las anomalías, al hacer que todas ocurrieran en la misma fecha, permitió que los LLM funcionaran mejor al reconocer el patrón según la fecha en lugar del movimiento de datos. Al evaluar los LLM, es extremadamente importante una configuración cuidadosa de las pruebas para evitar que los modelos detecten patrones no deseados que podrían sesgar los resultados.

Figura 3: Claude 3 supera significativamente a GPT-4 en el análisis de series temporales (imagen del autor)

En las pruebas, Claude 3 Opus superó significativamente a GPT-4 en la detección de anomalías en series temporales. Dada la naturaleza de las pruebas, es poco probable que esta evaluación específica se haya incluido en el conjunto de entrenamiento de Claude 3, lo que hace que su sólido desempeño sea aún más impresionante.

Resultados con un pico del 50%

Nuestro primer conjunto de resultados se basa en datos en los que cada anomalía representó un aumento del 50 % en los datos.