Los errores de pronóstico no son causados por malos modelos de series de tiempo.
Son causados por ignorar la estructura.
Los SKU no se comportan de forma independiente. Interactúan a través de plantas, grupos de productos, almacenes y ubicaciones de almacenamiento compartidos. Un impacto en la demanda de un SKU a menudo se propaga a otros; sin embargo, la mayoría de los sistemas de pronóstico modelan cada SKU de forma aislada.
En mi artículo anterior, mostramos que modelar explícitamente estas conexiones es importante. Utilizando un gráfico real de la cadena de suministro de bienes de consumo, una red neuronal gráfica simple (GraphSAGE) redujo el error de pronóstico a nivel de SKU en más de un 27 % en comparación con una línea de base sólida e ingenua, simplemente al permitir que la información fluya entre SKU relacionados.
Pero GraphSAGE hace una suposición simplificadora: todas las relaciones son iguales.
Una planta compartida se trata de la misma manera que un grupo de productos compartido. Los sustitutos y complementos se promedian en una sola señal. Esto limita la capacidad del modelo para anticipar cambios reales en la demanda.
Este artículo explora lo que sucede cuando al modelo se le permite no solo ver la red de la cadena de suministro, sino también comprender el significado de cada relación dentro de ella.
Mostramos cómo los transformadores de gráficos heterogéneos (HGT) introducen el aprendizaje consciente de las relaciones en el pronóstico de la demanda, y por qué ese cambio aparentemente pequeño produce pronósticos más anticipativos, distribuciones de errores más estrictas y resultados materialmente mejores, incluso en demanda intermitente y diaria por SKU, convirtiendo los pronósticos conectados en predicciones conscientes del significado y con base operativa.
Un breve resumen: lo que nos dijo GraphSAGE
En el artículo anterior, entrenamos un modelo GraphSAGE espacio-temporal en un gráfico real de la cadena de suministro de bienes de consumo con:
40 SKU 9 plantas 21 grupos de productos 36 subgrupos 13 ubicaciones de almacenamiento
Cada SKU estaba conectado a otros a través de plantas, grupos y ubicaciones compartidas, creando una densa red de dependencias operativas. Las características temporales mostraron una producción irregular y una demanda intermitente, un escenario común en el sector de bienes de consumo.
GraphSAGE permitió que cada SKU agregara información de sus vecinos. Eso produjo un gran salto en la calidad de los pronósticos.
En el nivel más estricto posible (demanda intermitente, diaria, por SKU), un WAPE de ~0,62 ya es casi de grado de producción en bienes de consumo masivo.
Pero los gráficos de error mostraron algo importante:
El modelo siguió bien las tendencias Manejó bien los ceros Pero suavizó los picos extremos Y reaccionó en lugar de anticiparse
Porque GraphSAGE supone que todas las relaciones son iguales. Suponer que todas las relaciones tienen el mismo peso significa que el modelo no puede aprender que:
Un aumento en la demanda de un SKU complementario en la misma planta debería aumentar mi pronóstico, pero un aumento en un SKU sustituto en el mismo grupo de productos debería reducirlo.
Veamos cómo el transformador de gráficos heterogéneos (HGT) aborda el desafío.
Lo que añade HGT: aprendizaje consciente de las relaciones
Los transformadores de gráficos heterogéneos están diseñados para gráficos donde:
Hay múltiples tipos de nodos (SKU, plantas, almacenes, grupos) y/o Hay múltiples tipos de bordes (plantas compartidas, grupos de productos, etc.)
En este caso, si bien todos los nodos del gráfico son SKU, las relaciones entre ellos son heterogéneas. Aquí, HGT no se utiliza para modelar múltiples tipos de entidades, sino para aprender a transmitir mensajes según las relaciones.
El modelo aprende mecanismos de transformación y atención separados para cada tipo de relación SKU-SKU, lo que permite que las señales de demanda se propaguen de manera diferente dependiendo de por qué están conectadas dos SKU.
Aprende:
"¿Cómo debería fluir la información en cada tipo de relación?"
Formalmente, en lugar de una función de agregación, HGT aprende:
[
h_i = sum_{r en {text{planta}, text{grupo}, text{subgrupo}, text{almacenamiento}}}
sum_{j in N_r(i)} alpha_{r,i,j} W_r h_j
]
dónde
r representa el tipo de relación operativa entre SKU (planta compartida, grupo de productos, etc.) Wᵣ permite que el modelo trate cada relación de manera diferente αᵣ,ᵢ,ⱼ permite que el modelo se centre en los vecinos más influyentes. El conjunto Nr(i) contiene todos los SKU que están conectados directamente a SKU i a través de una relación compartida r.
Esto permite que el modelo aprenda, por ejemplo:
Los bordes de la planta propagan señales de capacidad y producción. Los bordes de los grupos de productos propagan la sustitución y la transferencia de demanda. Los bordes del almacén propagan la reserva de inventario.
El gráfico se vuelve económicamente significativo, no sólo topológicamente conectado.
Implementación (alto nivel)
Al igual que en el modelo GraphSAGE, utilizamos:
El mismo conjunto de datos de SupplyGraph, características temporales, normalización log1p y ventana deslizante de 14 días.
La diferencia está en el codificador espacial. La siguiente es una descripción general de la arquitectura.
Codificador de gráficos heterogéneo Nodos: SKU Bordes: planta compartida, grupo compartido, subgrupo compartido y almacenamiento compartido Las capas HGT aprenden el paso de mensajes específicos de la relación Codificador temporal Un codificador de serie temporal procesa los últimos 14 días de incorporaciones Esto captura cómo evoluciona el gráfico con el tiempo Cabezal de salida Un regresor predice las ventas log1p del día siguiente por SKU
Todo lo demás (entrenamiento, pérdida, evaluación) sigue siendo idéntico a GraphSAGE. Por lo tanto, cualquier diferencia en el desempeño proviene puramente de una mejor comprensión estructural.
La analogía del mercado inmobiliario, ahora con significado
En el artículo anterior, utilizamos una analogía simple del mercado inmobiliario para explicar por qué funcionan los pronósticos basados en gráficos.
Actualicémoslo.
GraphSAGE: estructura sin significado
GraphSAGE es como predecir el precio de su casa mirando:
El precio histórico de tu casa El movimiento medio del precio de las casas cercanas
Esto ya mejora respecto al tratamiento de su casa de forma aislada. Pero GraphSAGE hace una suposición simplificadora crítica:
Todos los vecinos influyen en tu casa de la misma manera.
En la práctica, esto significa que GraphSAGE trata todas las entidades cercanas como señales idénticas. Una villa de lujo, una escuela, un centro comercial, una autopista o una fábrica son simplemente “vecinos” cuyas señales de precios se promedian juntas.
El modelo aprende que las casas están conectadas, pero no sabe por qué están conectadas.
HGT: estructura con significado
Ahora imaginemos un modelo de vivienda más realista.
Cada punto de datos sigue siendo una casa: no existen diferentes tipos de nodos.
Pero las casas están conectadas a través de diferentes tipos de relaciones:
Algunos comparten el mismo distrito escolar Algunos comparten el mismo constructor o calidad de construcción Algunos están cerca de parques Otros están cerca de autopistas o zonas industriales
Cada una de estas relaciones afecta los precios de manera diferente.
Las escuelas y los parques tienden a aumentar el valor. Las autopistas y las fábricas a menudo lo reducen. Las casas de lujo importan más que las descuidadas.
Un transformador de gráficos heterogéneo (HGT) aprende estas distinciones explícitamente. En lugar de promediar todas las señales vecinas, HGT aprende:
qué tipo de relación representa un vecino y con qué fuerza esa relación debería influir en la predicción.
Esa distinción es lo que convierte un pronóstico de demanda conectado en una predicción con base operativa y consciente del significado.
Comparación de resultados
Aquí está la comparación de WAPE de HGT con GraphSAGE y una línea de base ingenua:
Con un WAPE diario por SKU inferior a 0,60, el transformador de gráficos heterogéneo (HGT) ofrece un claro cambio gradual en el nivel de producción con respecto a la previsión tradicional y GraphSAGE. Los resultados muestran una reducción de aproximadamente el 32 % en la demanda mal asignada en comparación con el pronóstico tradicional y una mejora adicional del 6 al 7 % con respecto a GraphSAGE.
El siguiente gráfico de dispersión muestra las ventas reales frente a las previstas en la escala log1p tanto para GraphSAGE (puntos morados) como para HGT (puntos cian). Si bien ambos modelos son buenos, hay una mayor dispersión de puntos morados de GraphSAGE en comparación con la agrupación estrecha de los cian HGT, lo que corresponde a la mejora del 6% en WAPE.
A la escala de este conjunto de datos (≈ 1,1 millones de unidades), esa mejora se traduce en ~45 000 unidades menos asignadas incorrectamente durante el período de evaluación.
Desde el punto de vista operativo, reducir la asignación inadecuada en esta magnitud conduce a:
Menos cambios de producción de emergencia Menores costos de expedición y flete premium Operaciones de planta y almacén más estables Mejores niveles de servicio en SKU de gran volumen Menos inventario atrapado en ubicaciones equivocadas
Es importante destacar que estas mejoras se realizan sin agregar reglas comerciales, anulaciones del planificador ni ajustes manuales.
Y la comparación de sesgos es la siguiente:
HGT introduce un sesgo positivo muy pequeño: aproximadamente entre el 1% y el 2%.
Esto está dentro de los límites de seguridad de la producción y se alinea con la forma en que operan en la práctica los planificadores de bienes de consumo, donde a menudo se prefiere un ligero sesgo al alza para evitar desabastecimientos. El siguiente histograma confirma una distribución gaussiana centrada alrededor de cero, lo que indica un desempeño imparcial en días típicos de pronóstico.
La diferencia real entre GraphSAGE y HGT es evidente cuando comparamos los pronósticos para los 4 principales SKU por volumen. Aquí está el gráfico GraphSAGE:
Y lo mismo para HGT:
La distinción es evidente en el área resaltada en el primer gráfico y en todos los demás SKU:
HGT no es reactivo como GraphSAGE. Es un pronóstico más sólido, que anticipa y sigue los picos y valles de la demanda real, en lugar de suavizar las fluctuaciones. Esto es el resultado del aprendizaje diferencial de las relaciones estructurales entre SKU vecinas, lo que le permite predecir con confianza el cambio en la demanda antes de que ya haya comenzado.
Y, finalmente, el rendimiento de las SKU con volúmenes distintos de cero muestra claramente que todas las SKU de alto volumen tienen un WAPE <0,60, lo cual es deseable para un pronóstico de producción y es una mejora con respecto a GraphSAGE.
Explicabilidad
HGT hace que sea práctico implementar la explicabilidad de los pronósticos, algo esencial para que los planificadores tengan confianza en la causalidad de las características. Cuando el modelo predice una caída, y podemos demostrar que se debe a que “el vecino X en el mismo subgrupo tiene una tendencia a la baja”, los planificadores pueden validar la señal con respecto a la logística del mundo real, convirtiendo una predicción de IA en información empresarial procesable.
Veamos la influencia de diferentes características espaciales y temporales durante el pronóstico de los primeros 7 días y los últimos 7 días de duración para el SKU con mayor volumen (SOS001L12P). Aquí está la comparación de las características temporales:
Y las características espaciales:
Los gráficos muestran que diferentes características y SKU/bordes desempeñan un papel durante diferentes períodos de tiempo:
Durante los primeros 7 días, Sales Lag(7d) tiene la máxima influencia (23%), que cambia a Rolling Mean (21%) durante los últimos 7 días. De manera similar, durante los primeros 7 días, existe una gran dependencia de SOS005L04P, probablemente un nodo de almacenamiento primario o SKU precursor que dicta la disponibilidad inmediata. Al final de la duración de la prueba, la influencia se redistribuye. SOS005L04P comparte escenario con SOS002L09P (~40 % de participación cada uno), ambos del mismo subgrupo que nuestro SKU objetivo. Esto sugiere que el modelo ahora está agregando señales de un subgrupo más amplio de productos relacionados para formar una visión más holística.
Este tipo de análisis es crucial para comprender y pronosticar los impactos de las campañas de marketing y promociones o factores externos como las tasas de interés en SKU específicos. Estos deben incluirse en la estructura espacial como nodos adicionales en el gráfico con los SKU vinculados a él.
No todas las cadenas de suministro son iguales
El caso de uso aquí es un caso relativamente simple con solo SKU como nodos. Y eso se debe a que en el sector de bienes de consumo, las plantas y los almacenes actúan en gran medida como amortiguadores: suavizan la volatilidad pero rara vez detienen el sistema. Es por eso que HGT podría aprender gran parte de su efecto únicamente a partir de tipos de borde como planta compartida o almacén compartido sin modelarlos como nodos explícitos. Las cadenas de suministro pueden ser mucho más complejas. Por ejemplo, las cadenas de suministro de automóviles son muy diferentes. Un taller de pintura, una línea de motores o un centro de distribución regional es un cuello de botella difícil de capacidad: cuando está limitado, la demanda de acabados o colores específicos colapsa independientemente de la demanda del mercado. En ese entorno, HGT todavía se beneficia de las relaciones tipificadas, pero también requiere nodos explícitos de Planta y Almacén con sus propias señales de series de tiempo (capacidad, producción, retrasos, retrasos) para modelar cómo la física del lado de la oferta interactúa con la demanda de los clientes. En otras palabras, FMCG necesita gráficos que tengan en cuenta la estructura; La automoción necesita gráficos que tengan en cuenta la causalidad.
Otros factores que son comunes en todas las industrias son las promociones, los gastos en marketing, la estacionalidad, factores externos como las condiciones económicas (por ejemplo, precios del combustible) o los lanzamientos de competidores en un segmento. Estos también afectan a los SKU de diferentes maneras. Por ejemplo; El aumento del precio del combustible o una nueva regulación pueden frenar las ventas de vehículos ICE y aumentar la venta de vehículos eléctricos. Estos factores deben incluirse en el gráfico como nodos y sus relaciones con los SKU incluidos en el modelo espacial. Y sus características temporales deben incluir los datos históricos de cuándo ocurrieron los hechos. Esto permitiría a HGT conocer los efectos de estos factores sobre la demanda en las semanas y meses posteriores al evento.
Conclusiones clave
La demanda de la cadena de suministro no sólo está conectada: está estructurada. Tratar todas las relaciones de SKU como hojas iguales no aprovecha todo el potencial predictivo. GraphSAGE demuestra que las redes importan: simplemente permitir que las SKU intercambien información entre plantas, grupos y ubicaciones compartidas ofrece un gran salto en precisión con respecto a la previsión clásica. Heterogeneous Graph Transformers va un paso más allá al aprender por qué los SKU están conectados. Una planta compartida, un subgrupo compartido y un almacén compartido no propagan la demanda de la misma manera, y HGT aprende esa distinción directamente de los datos. Esa conciencia estructural se traduce en resultados reales: menor WAPE, mayor dispersión de pronósticos, mejor anticipación de picos y materialmente menos unidades mal asignadas, sin reglas de negocio, ajustes manuales ni anulaciones de planificadores. La explicabilidad se vuelve operativa, no cosmética. La atención consciente de las relaciones permite a los planificadores rastrear los pronósticos hasta llegar a factores económicamente significativos, convirtiendo las predicciones en decisiones confiables. La lección más amplia: a medida que las cadenas de suministro se vuelven más interdependientes, los modelos de pronóstico deben evolucionar desde sistemas basados únicamente en series temporales a sistemas conscientes de las relaciones. En FMCG, esto significa gráficos con reconocimiento de estructura; en industrias más restringidas como la automotriz, significa gráficos que tienen en cuenta la causalidad con cuellos de botella explícitos.
En resumen: cuando el modelo comprende el significado de las conexiones, la previsión deja de ser reactiva y empieza a ser anticipatoria.
¿Qué sigue? De los conceptos al código
A lo largo de este artículo y del anterior, avanzamos paso a paso a través de la evolución del pronóstico de la demanda, desde modelos aislados de series de tiempo hasta GraphSAGE y, finalmente, transformadores de gráficos heterogéneos, mostrando cómo cada cambio mejora progresivamente la calidad del pronóstico al reflejar mejor cómo operan las cadenas de suministro reales.
El siguiente paso lógico es pasar de los conceptos al código.
En el próximo artículo, traduciremos estas ideas en un flujo de trabajo implementable de un extremo a otro. Usando ejemplos de código enfocados, explicaremos cómo:
Construir el gráfico de la cadena de suministro y definir tipos de relaciones Diseñar características temporales para demanda intermitente a nivel de SKU Diseñar y entrenar modelos GraphSAGE y HGT Evaluar el rendimiento utilizando métricas de grado de producción Visualizar pronósticos, errores y atención consciente de las relaciones Agregar explicabilidad para que los planificadores puedan entender por qué cambió un pronóstico
El objetivo no es sólo mostrar cómo entrenar un modelo, sino cómo construir un sistema de pronóstico basado en gráficos interpretable y listo para producción que los profesionales puedan adaptar a sus propias cadenas de suministro.
Si este artículo explica por qué son importantes la estructura y el significado, el siguiente mostrará exactamente cómo hacer que funcionen en código.
Conéctese conmigo y comparta sus comentarios en www.linkedin.com/in/partha-sarkar-lets-talk-AI
Referencia
SupplyGraph: un conjunto de datos de referencia para la planificación de la cadena de suministro utilizando redes neuronales gráficas: Autores: Azmine Toushik Wasi, MD Shafikul Islam, Adipto Raihan Akib
Las imágenes utilizadas en este artículo se generan con Google Gemini. Gráficos y código subyacente creados por mí.