Teoría de la información y modelos de conjuntos
Imagen de Pexels

Al salir de la pandemia, los estadísticos se han topado con una serie de complicaciones geopolíticas que aumentan aún más la incapacidad de pronosticar variables comerciales con precisión. ¿Ucrania hizo subir los precios minoristas en 2022 o fue la flexibilización cuantitativa en 2021 la culpable? Algunos modelos dicen una cosa y otros otra, lo que dificulta pronosticar con precisión la inflación.

En la base misma de la econometría, nos basamos en minimizar la distancia (MSE, RMSE, etc.) entre dos puntos (pronóstico, real) en el mismo dominio (tiempo, frecuencia). Todo esto ha servido enormemente a la comunidad para mejorar la precisión de los pronósticos. Hay algunas razones por las que estas métricas son populares:

Son no paramétricos. Todos los modelos de significado desarrollados utilizando diferentes suposiciones y estructuras se pueden comparar, ya que el resultado final es el mismo: precisión. Históricamente, ha sido cierto que estas métricas ofrecen suficiente variación en la distribución residual para que podamos clasificar diferentes modelos y agrupar su desempeño. Por ejemplo, nos ayudan a responder si una clase de modelos ARMA se adapta mejor a los datos o una clase de modelos de espacio de estados. De manera más general, ayuda a clasificar los algoritmos de mejor ajuste. A menudo, se asientan en geometrías euclidianas y tienen buenas propiedades que facilitan mucho la construcción de métodos más nuevos y sofisticados sobre ellas. La topología de medición no cambia. Esto desbloquea el potencial para realizar transformaciones y representaciones de los datos, el modelo o ambos para extraer relaciones más profundas. Los modelos de ML modernos se crean aprovechando esta propiedad clave. WLOG, nos centraremos en modelos econométricos simples a los efectos de este artículo.

Estos beneficios han ayudado a mejorar los paquetes estadísticos desde finales de los años 40, hasta el punto de que hoy tenemos paquetes más generales que pueden seleccionar los modelos que mejor se ajustan sin que el usuario tenga que asumir una estructura.

Sin embargo, como ocurre con cualquier situación, continuar optimizando las mismas métricas ofrece cada vez menos mejoras con cada iteración. Las métricas que miden la distancia ya no pueden ofrecer suficiente separación entre los modelos optimizados, lo que dificulta la clasificación del rendimiento.

Entonces, ¿qué hacemos?

Las posibles soluciones pueden venir de dos caminos diferentes:

Crear nuevas métricas dentro de la misma topología que puedan mejorar la mejor clasificación de bits: la comunidad ha creado y utiliza ampliamente nuevas métricas como AIC, AICc, BIC, BICc, etc., pero estas métricas a menudo son específicas del modelo en el sentido de que podrían permitirnos clasificar los modelos ARMA entre sí, pero no pueden comparar los modelos ARMA con los ETS, por ejemplo. Proponer nuevas geometrías y topologías para métodos mejorados: exploro una versión de esta idea a través de redes causales más amplias, que es en gran medida un trabajo en progreso pero continúa mostrando un potencial inmenso (quizás estoy parcializado dado mi interés en el tema). Los lectores interesados ​​pueden encontrar una introducción a mi enfoque aquí.

Empecemos primero por contextualizar los argumentos hasta el momento sobre datos reales. Voy a analizar las tendencias y variables inflacionarias y con qué precisión podemos pronosticar el IPC utilizando los modelos existentes. Casi todos los econometristas utilizan las siguientes variables al considerar un modelo de inflación:

Crecimiento interanual del índice de precios al consumidor: medida de la inflación para los consumidores; lado de la demanda Índice de Precios al Productor Crecimiento interanual – medida de inflación para los productores; Tasa de ahorro del lado de la oferta: % del ingreso del trabajo que se ahorra; mide la fricción en el lado de la demanda Crecimiento intermensual de los inventarios empresariales: exceso de existencias de bienes que las empresas tienen cada mes; Mide la fricción en el lado de la oferta.

A continuación se muestra un gráfico causal bivariado de Granger de las 4 variables:

La red causal ya ayuda a explicar algunos detalles clave sobre los datos. En primer lugar, la tasa de ahorro puede influir tanto en el lado de la demanda como en el lado de la oferta de la economía. En segundo lugar, la inflación para los productores significa cierta retroalimentación para los consumidores. Estas son buenas comprobaciones de cordura para asegurarnos de que estamos considerando las variables correctas.

Profundizando un poco más, ajustemos un modelo VAR no paramétrico genérico y consideremos algunas sensibilidades a shocks no causales e inducidos aleatoriamente:

Los gráficos muestran impulso-respuesta en un modelo VAR ajustado.
Los gráficos muestran impulso-respuesta en un modelo VAR ajustado.

En una nota tangencial, la primera trama confirma la infame Hipótesis del Ingreso Permanente, conceptualizada por Milton Friedman en 1957: un aumento inesperado en los ahorros de la gente hoy, digamos debido a una decisión del gobierno de entregar cheques de estímulo, lleva a que ese exceso de ahorro se bombee a la economía en los períodos siguientes, lo que lleva a una inflación de demanda. También hace que el stock de inventarios empresariales se contraiga hasta que se normalicen nuevamente a nuevos niveles.

No podemos persuadir a la gente a ahorrar más mañana, incluso si aumentamos su ingreso disponible, si ninguna razón explícita los obliga a hacerlo. Las expectativas futuras de los consumidores desempeñan un papel crucial en los juicios políticos.

De manera similar, a medida que los productores experimentan costos de producción más altos, evidentes a través de aumentos en el IPP, los trasladan a los consumidores, lo que genera una inflación impulsada por la oferta, como se muestra en el último gráfico.

Al menos direccionalmente, el modelo VAR confirma algunas teorías económicas. Desafortunadamente, el siglo XXI requiere precisión, no dirección. Incluso si confiamos en las conclusiones cualitativas, los econometristas tienen la tarea de afinar las decisiones y políticas. ¿Por qué la Reserva Federal aumenta los tipos 75 pb cada trimestre y no 65 pb?

¿Cómo podemos realizar mediciones precisas y exactas utilizando múltiples modelos aplicados a los mismos datos? A continuación se presentan algunas métricas que miden la precisión de los pronósticos fuera de la muestra, adaptando tres modelos de pronóstico diferentes a nuestros datos de inflación. Está claro que no podemos diferenciar eficazmente las prestaciones entre 2 de los 3 modelos.

Conjunto de modelos

La necesidad de conjuntos de pronóstico surge del hecho de que, dado que nuestras métricas tradicionales de precisión no ofrecen suficiente separación de desempeño, nunca podemos decir, con confianza concreta, que un tipo de modelo puede capturar la dinámica verdadera y causal entre un conjunto de series de tiempo. Entonces, si ningún modelo parece llegar a la cima, ¿podemos sopesar los resultados de todos los modelos de alguna manera para un conjunto combinado?

La tarea entonces es encontrar la mejor manera de ponderar los pronósticos, lo que nuevamente requiere medir la diferencia en el desempeño de alguna forma.

De vuelta al punto de partida.

Aquí es donde volvemos a la idea de conceptualizar una nueva métrica.

El problema del modelado de conjuntos ha inspirado muchas soluciones en la literatura reciente y todas las soluciones han tenido un rasgo en particular: se inspiran en la simple idea de que cuando se mira un problema desde una lente diferente, podemos aprender más sobre el problema y adaptar nuestras formas para acomodar las complejidades añadidas.

Con el mismo espíritu, me gustaría proponer un marco, aunque incipiente y muy abierto a correcciones, de modelado de conjuntos informado por la teoría de la información. Ahorraré al lector el marco matemático y trataré de formular explicaciones únicamente a partir de la intuición pragmática.

Los intimidantes símbolos griegos ya han ahuyentado a muchas mentes de estudiar nuevas disciplinas y no tengo la intención de contribuir a esa pérdida. Preferiría que las ideas se difundieran entre los lectores y no la jerga. Para los lectores que deseen un diseño de ingeniería del marco, la “Teoría de la información” de Fazlollah M. Reza es una excelente fuente para comenzar y establecer paralelos intuitivos con los problemas de econometría.

Teoría de la información

Las metodologías de pronóstico clásicas incluyen ARIMAX, suavizado exponencial, regresiones polinómicas, regresiones armónicas y modelos de espacio de estados, y cada una de ellas requiere una suposición sobre la estructura de la serie temporal en sí. En términos de teoría de la información –

R. Cada una de estas metodologías observa una fuente que transmite información.

B. Habiendo comprendido la naturaleza de la información, intentan predecir señales futuras que pueden provenir de la fuente.

C. Si estas metodologías comprenden perfectamente la dinámica de la fuente, podrán pronosticarla mejor en el futuro sin desperdiciar información más que algún ruido estocástico en la transmisión.

Si podemos cuantificar esta medida de información, o su falta, tal vez podamos comenzar a construir esquemas conjuntos cuantitativos para optimizarlos.

Primero definamos esta medida de información:

Definición de entropía de Shanon
Definición de entropía de Shanon

donde 𝑓̂(𝜆) es una estimación de la densidad sp_ectral de los datos. Esta métrica puede parecer complicada, pero es un resultado natural de la lógica combinatoria destacada por Fazlollah M. Reza.

La densidad espectral es una métrica definida en el dominio de la frecuencia y describe cuán densamente puede distribuirse una señal que transporta información en diferentes frecuencias:

Al igual que las métricas que miden la distancia entre dos puntos, la entropía también tiene propiedades que la convierten en una métrica útil a considerar. Por ejemplo:

Es no paramétrico. La entropía está limitada por [0,1]. Cuanto más cerca estén los datos de ser ruido blanco, es decir, de no tener información discernible, más cerca estará el valor de entropía de 1. Si somos buenos pronosticando la información, los residuos deberían parecerse más al ruido blanco. No cambia la topología. Se necesita una simple transformada de Fourier, que es una transformación inyectiva (es decir, simplemente reforma la información de los datos pero no la dobla ni la tuerce).

Esto sólo deja por probar la propiedad crítica de ofrecer separación en el rendimiento entre modelos.

¡Voilá! Una diferencia de rendimiento entre los 3 modelos. A continuación se muestra un esquema aproximado que introduce la inferencia basada en entropía para estimar los pesos de conjunto entre los 3 modelos.

Es importante señalar que lo anterior es un esquema de inferencia y no un esquema de optimización. El usuario especifica qué umbrales de entropía deben satisfacer las ponderaciones del modelo, mientras que un conjunto de optimización encontraría ponderaciones que maximicen la entropía de los residuos; esto requeriría una función objetivo con restricciones adecuadas para garantizar soluciones.

La optimización de la entropía es el siguiente paso natural, pero está fuera del alcance de este artículo.

La intuición de este esquema es la siguiente: estamos estimando la probabilidad con la que podemos decir que el modelo X es una buena representación de nuestra fuente que emite información. La medida de esa información es la entropía. Para poner en práctica nuestro esquema, a continuación se muestran algunos resultados de los datos de inflación:

Para el conjunto de inferencia de entropía, establecí el umbral mínimo de entropía en 0,75 y, curiosamente, la entropía fuera de la muestra de los residuos pronosticados es mucho mayor y el rendimiento de precisión está a la par con el conjunto basado en la distancia. Sin embargo, su entropía todavía está por debajo de un conjunto basado en la distancia, lo que significa que todavía hay información en los residuos que nuestro conjunto no ha analizado. Hay algunas razones por las que nuestro nuevo conjunto es inferior:

Umbral de entropía más bajo para el entrenamiento. Dado que se trata de un modelo basado en inferencia, no sería sorprendente que diferentes combinaciones de umbrales de entrenamiento pudieran producir una entropía residual fuera de muestra más alta. El conjunto basado en la distancia no está acotado, mientras que el conjunto de entropía está acotado. Los pesos de conjunto que asigna el modelo de distancia pueden, para este proyecto, volverse negativos o explotar y podrían conducir a un sobreajuste. No se consideran suficientes modelos únicos para ensamblar. En este ejercicio se analizaron sólo 3 modelos para ensamblar juntos; La inferioridad sistémica de estos modelos relacionada con la entropía también agregará inferioridad al conjunto. Afortunadamente, el esquema de conjunto se puede extender a N modelos.

Conjunto basado en la distancia
Conjunto basado en la distancia
Conjunto basado en entropía: el modelo 1 comparte pesos iguales que el modelo 2 y luego pesos iguales que el modelo 3. En consecuencia, sus pesos quedan enmascarados en la trama.
Conjunto basado en entropía: el modelo 1 comparte pesos iguales que el modelo 2 y luego pesos iguales que el modelo 3. En consecuencia, sus pesos quedan enmascarados en la gráfica.
Pesos para el Modelo 1 en conjunto basado en entropía
Pesos para el Modelo 1 en conjunto basado en entropía

A continuación se muestran los pronósticos de inflación que los dos conjuntos publicaron en relación con la Reserva Federal de St. Louis utilizando sus propios datos.

En general, la necesidad de la comunidad de dar un paso atrás y observar los problemas de pronóstico bajo lentes más nuevos puede ofrecer muchos avances tanto en la forma en que modelamos la solución como en la eficiencia de nuestras soluciones actuales. La entropía es uno de esos enfoques y todavía queda camino por recorrer.

Espero que los lectores puedan establecer paralelos entre los problemas que están resolviendo y evaluar si un cambio en la topología o una nueva métrica como la entropía puede ayudarlos a acercarse a la solución.

Todas las imágenes del autor a menos que se indique lo contrario.

Vedant Bedi es analista de Mastercard y trabaja en el equipo de desarrollo de cartera de NAM. Tiene una licenciatura en Matemáticas y Economía de la Universidad de Nueva York y tiene un ávido interés en la ciencia de datos, la econometría y sus numerosas aplicaciones en las finanzas.

Vedant también es miembro incorporado de Phi Beta Kappa (capítulo de Nueva York), la sociedad de honores académicos más antigua de los Estados Unidos.