manera de entender los nuevos modelos básicos de series de tiempo, así que elegí uno reciente que podía ejecutar. t0-alpha es un pronosticador probabilístico de 102M de parámetros de The Forecasting Company, lanzado en junio de 2026. The Forecasting Company publicó los pesos abiertamente bajo Apache-2.0, que es lo que hace posible esta reproducción: el modelo es lo suficientemente pequeño como para ejecutarse en hardware accesible y se envía con resultados de GIFT-Eval que se pueden verificar fuera del laboratorio original.
El modelo muestra la receta básica detrás de muchos LLM de series temporales actuales. Corta una secuencia numérica en parches, procesa esos parches con un transformador causal y emite cuantiles en lugar de un
única línea futura. Esto está lo suficientemente cerca del modelado del lenguaje como para que la analogía sea útil, pero lo suficientemente diferente como para que los detalles importen.
También volví a ejecutar el punto de referencia. En GIFT-Eval, t0-alpha reprodujo exactamente las cifras de sus titulares: CRPS 0,4941 y MASE 0,7240.
Esta publicación utiliza t0-alfa para explicar cómo funcionan los modelos básicos de series de tiempo, cómo se evalúan, dónde superan las líneas de base clásicas, dónde aún fallan y por qué las próximas ganancias útiles pueden provenir de la calibración, el enrutamiento, el control de fugas, líneas de base más sólidas y estimadores de dominio específico en lugar de otra pequeña variación del transformador. Todas las imágenes de este artículo son de creación propia del autor.
Cómo el modelo convierte una serie temporal en algo que un transformador puede leer
Un modelo de lenguaje comienza con tokens. Un modelo básico de series de tiempo tiene que generar tokens a partir de números.
t0-alpha hace esto cortando la entrada en ventanas fijas de 32 pasos de tiempo. Cada ventana se convierte en un parche. El modelo incorpora esos parches, los pasa a través de un transformador estilo decodificador y predice cuantiles futuros.
La parte causal importa. Cuando t0-alpha pronostica la siguiente ventana, sólo puede atender al pasado. No ve la ventana de respuesta durante la generación.
La parte cuantil también importa. El modelo no se limita a trazar una línea futura esperada. Emite un conjunto de cuantiles, que representan una distribución de pronóstico. En mi carrera utilicé nueve niveles cuantiles, desde
0,1 a 0,9.
Por eso CRPS es una métrica útil aquí. Recompensa a un modelo por ser preciso y por poner la cantidad adecuada de incertidumbre en torno al pronóstico. Un pronóstico estrecho que falla gravemente es castigado. También se castiga un pronóstico amplio que evita equivocarse diciendo muy poco.
La configuración t0-alfa exacta que evalué fue:
La propiedad práctica más importante es que t0-alfa es probabilístico. Los pronósticos rara vez se centran únicamente en la línea media. Un modelo útil también debería indicar cuándo no está seguro.
La segunda propiedad práctica es la apertura. Los pesos están disponibles en Hugging Face en Apache-2.0 y el paquete se instala con:
instalación de pip tfc-t0
En parámetros de 102M, t0-alfa es pequeño según los estándares del modelo básico. También es lo suficientemente pequeño como para ejecutarse en una única GPU de gama media. Esa combinación lo hace útil para un tutorial: pesos abiertos, tamaño de modelo manejable y números de referencia que se pueden reproducir fuera del laboratorio original.
capas de atención de tiempo y atención de grupo, y decodificadas en cuantiles futuros en lugar de un pronóstico de un solo punto.
Dos tipos de LLM de series temporales
La frase "LLM de series temporales" se utiliza para dos cosas diferentes.
El primer tipo se entrena de forma nativa con datos de series temporales. Estos modelos convierten secuencias numéricas en parches o tokens, entrenan un transformador en muchos conjuntos de datos de pronóstico y producen pronósticos directamente. t0-alpha, TimesFM, Toto, Chronos, TiRex y Moirai se encuentran en general en este grupo, aunque sus arquitecturas difieren.
El segundo tipo comienza con un LLM de texto previamente entrenado y lo adapta a la previsión. Estos sistemas reprograman, solicitan o ajustan un modelo de lenguaje para que pueda procesar secuencias numéricas. Time-LLM es un
ejemplo representativo de esta dirección.
Este artículo trata sobre el primer tipo.
No todos los modelos de ese primer grupo funcionan de la misma manera. t0-alpha, TimesFM y Toto son pronosticadores causales basados en parches. Chronos cuantifica valores continuos en un vocabulario discreto y utiliza un codificador-decodificador estilo T5. Moirai utiliza un codificador enmascarado y está diseñado para números arbitrarios de variables.
La receta compartida ahora es bastante estable: columna vertebral transformadora, preentrenamiento amplio de series temporales, resultados probabilísticos y evaluación de disparo cero en muchos dominios. t0-alpha es útil porque es un ejemplo claro de esa receta.
Configuración del punto de referencia GIFT-Eval
Utilizo GIFT-Eval como punto de referencia principal en este artículo. Tiene 97 configuraciones de tareas de 55 conjuntos de datos en siete dominios. Incluye horizontes cortos y largos, frecuencias de segundo a anual,
series univariadas y multivariadas, y puntuación probabilística.
También incluye varios conjuntos de datos que aparecen repetidamente en el trabajo de pronóstico, incluidos M4, ETT y una gran parte del archivo Monash. Esa amplitud lo convierte en un punto de referencia útil para comparar
Modelos de pronóstico de propósito general.
Las dos métricas principales son MASE y CRPS.
Ambos puntajes se normalizan contra Seasonal Naive, la línea de base que se repite la temporada anterior. Una puntuación de 1000 significa que el modelo coincide con esa línea de base. Las puntuaciones por debajo de 1.000 son mejores y las puntuaciones por encima de 1.000 son peores.
En mi carrera, t0-alpha obtuvo 0,4941 CRPS. Bajo la normalización de media geométrica de GIFT-Eval, eso coloca su error probabilístico en aproximadamente la mitad de la línea de base Seasonal Naive.
La puntuación agregada ofrece una comparación amplia entre el índice de referencia. Los resultados a nivel de tarea aún son necesarios para ver dónde el modelo es fuerte, dónde es débil y dónde un profesional debería realizar su propia evaluación.
Volver a ejecutar el ejemplo
Volví a ejecutar cuatro modelos básicos de principio a fin en una instancia de AWS g5.xlarge con una GPU NVIDIA A10G de 24 GB:
Este no es un punto de referencia de hardware. Utilicé la misma instancia de AWS g5.xlarge con una GPU NVIDIA A10G de 24 GB para mantener las ejecuciones lo más consistentes posible.
La ejecución t0-alfa produjo CRPS 0,4941 y MASE 0,7240, lo que coincide con las cifras informadas con cuatro decimales.
También revisé el arnés de puntuación con Seasonal Naive. Seasonal Naive es determinista y no tiene parámetros aprendidos, por lo que es una forma útil de probar la métrica, la normalización y el código de agregación. Mi ejecución reprodujo la referencia oficial de GIFT-Eval casi exactamente en MASE y de cerca en CRPS en todas las tareas que cubrí.
Esto me da confianza en la configuración de la puntuación. Esto no significa que haya regenerado de forma independiente todos los resultados de la tabla de comparación. Para los modelos que no ejecuté limpiamente en el mismo hardware, uso el
números de referencia oficiales de GIFT-Eval y márquelos como tales.
Moirai-base, por ejemplo, no encajaba cómodamente en la GPU de 24 GB para un conjunto de datos multivariado nativo. Por lo tanto, utilizo el número oficial de GIFT-Eval para esa fila. Las líneas de base clásicas y varias
Las filas de la tabla de clasificación también son referencias oficiales en lugar de mis propias reposiciones.
Variación entre carreras cerca de la cima de la clasificación
Las brechas cerca de la parte superior de la clasificación son pequeñas, por lo que verifiqué cuánta variación puede aparecer incluso cuando se ejecuta el mismo modelo.
Cuando volví a ejecutar Chronos-Bolt-base en mi máquina y lo comparé tarea por tarea con la referencia oficial para el mismo modelo y código, el CRPS por tarea difería hasta en 0,068. La diferencia media fue de 0,0055.
Eso es importante porque la brecha entre t0-alfa y cronos-2 en la siguiente tabla es de aproximadamente 0,009. No defendería demasiado la fina ordenación de los modelos líderes. La lectura más segura es competitiva.
grupo en lugar de una clasificación precisa.
Donde se encuentra t0-alfa
Todas las cifras a continuación son puntuaciones normalizadas estacionalmente ingenuas y con media geométrica. Más bajo es mejor.
Algunas cosas destacan.
t0-alpha supera todas las bases clásicas en este punto de referencia. También supera a dos modelos de cimientos estrictamente más grandes en esta tabla: timesfm-2.0–500m con aproximadamente cinco veces su tamaño, y timesfm-1.0 con aproximadamente
el doble de su tamaño. Ambos modelos más grandes están marcados como fugas en GIFT-Eval.
t0-alpha también se encuentra dentro de un grupo limpio y compacto:
El diferencial de 0,481 a 0,496 es de sólo 0,015 CRPS. Dada la variación entre carreras anterior, no lo interpretaría como una clasificación estable. Estos modelos están cerca.
t0-alpha no es el mejor modelo de precisión por parámetro aquí. TiRex tiene solo 35 millones de parámetros y obtiene una puntuación ligeramente mejor. La brecha de precisión es lo suficientemente pequeña como para que no la sobrepase, pero el tamaño
la diferencia es real.
t0-alpha es un modelo pequeño, abierto y reproducible que se encuentra en el grupo competitivo, aunque los modelos limpios más pequeños pueden igualarlo o superarlo.
grupo de modelos básicos de series de tiempo recientes.
Donde t0-alfa es útil
t0-alfa rara vez colapsa. De las 97 tareas, pierde frente a Seasonal Naive en exactamente una. En 96 de 97 configuraciones, supera la línea base estándar de repetición estacional.
Esa coherencia importa en la práctica. Muchos sistemas de pronóstico implementados se juzgan por la frecuencia con la que producen fallas embarazosas cuando se apuntan a una nueva serie. La puntuación agregada de t0-alpha es útil, pero su amplia coherencia entre tareas es al menos igual de relevante.
Un ejemplo concreto son los nacimientos diarios en Estados Unidos.
Este es el tipo de resultado que hace atractivos los modelos de cimentación. No hay ingeniería de características específicas del conjunto de datos ni ajuste por serie, pero el modelo aún produce una fuerte probabilidad probabilística.
pronóstico.
Donde t0-alfa es débil
Los puntos débiles son específicos más que amplios. Los peores valores de CRPS normalizados provienen de datos multivariados de observabilidad de TI a largo plazo y dos frecuencias M4.
bizitobs_application/long es la única tarea en la que t0-alpha es peor que Seasonal Naive.
La lección práctica es sencilla. Si su carga de trabajo parece datos de observabilidad multivariados a largo plazo, no asuma que la puntuación agregada de t0-alfa se transferirá. Evaluar en su propia serie.
El fallo claro contra Seasonal Naive es bizitobs_application/long.
Qué tan fuertes son las líneas de base clásicas afinadas
La clasificación puede hacer que los pronósticos clásicos parezcan más débiles de lo que son.
ARIMA vence a Seasonal Naive en 55 de 97 tareas. Su puntaje agregado parece mediocre porque tiene algunas fallas graves, no porque sea débil en todas partes.
Dividido por horizonte, el patrón es más claro.
ARIMA supera la línea de base en horizontes cortos, la iguala en horizontes medianos y se mantiene razonablemente cerca en horizontes largos. Theta se degrada más bruscamente a medida que crece el horizonte.
Los mayores fallos provienen principalmente de datos de alta frecuencia. GIFT-Eval ejecuta los modelos clásicos en modo automático predeterminado, un ajuste por serie, con especificaciones estacionales limitadas. Un tiempo de diez segundos o cada hora.
Las series pueden tener varios ciclos estacionales, pero un modelo predeterminado solo puede informar sobre uno de ellos.
Eso hace que la línea de base clásica sea más débil de lo que normalmente implementaría un profesional.
Un cheque clásico afinado
Para probar eso, volví a ejecutar un modelo clásico optimizado usando MSTL con períodos multiestacionales sensibles. El objetivo era comprobar si las líneas de base clásicas predeterminadas tenían poca potencia.
El primer conjunto de datos fue el más útil: bizitobs_application/10S, una serie de observabilidad de TI de alta frecuencia donde el ARIMA predeterminado colapsa y donde t0-alfa también es débil.
En este conjunto de datos, el colapso del método clásico fue principalmente un problema de período estacional faltante. Una vez que a MSTL se le da la estructura estacional correcta, supera a t0-alfa en todos los horizontes.
Ese conjunto de datos único no es representativo. En once tareas de alta frecuencia, MSTL optimizado reduce la brecha pero no la elimina.
La afinación reduce aproximadamente a la mitad la brecha clásica. El valor predeterminado 1.299 de ARIMA se convierte en 0.571 de MSTL sintonizado, lo cual es una gran mejora. t0-alpha aún gana en total y gana en ocho de los once de alta frecuencia
tareas.
Las tareas de control de baja frecuencia apuntan en otra dirección. En cuatro series diarias y mensuales, MSTL sintonizado supera ligeramente a t0-alfa en conjunto, 0,415 a 0,468 CRPS normalizado. La muestra es pequeña y el margen es sensible a conjuntos de datos individuales, por lo que lo trataría como un piloto en lugar de un resultado establecido.
La guía práctica es:
Para obtener datos diarios o mensuales limpios, un modelo clásico bien especificado sigue siendo difícil de superar. Para datos heterogéneos de alta frecuencia, el modelo básico se gana la vida. Para producción, probaría ambos y mantendría la opción de enrutar entre ellos.
Lectura de las banderas de fuga
Las fugas son un problema grave en la evaluación de modelos básicos de series temporales. Los conjuntos de datos públicos se reutilizan. Los corpus previos al entrenamiento suelen ser amplios. Una vez que un conjunto de datos ingresa al conjunto de preentrenamiento de un modelo, ya no es un punto de referencia limpio para ese modelo.
Eso hace que las señales de fuga de GIFT-Eval sean importantes. Las banderas en esta comparación son:
Los modelos que están por delante de t0-alpha en la tabla, STRIDE, Toto-2.0–313m, cronos-2, TiRex y TimesFM-2.5, no están marcados con fugas. Los modelos marcados son los latidos t0-alfa. Entonces la fuga no explica
La diferencia entre t0-alfa y los líderes. Los líderes en esta comparación están limpios bajo las banderas del índice de referencia.
El punto de fuga corre en dirección contraria para dos de las victorias de t0-alpha. Los modelos más grandes de TimesFM que supera están marcados. Eso no invalida la comparación, pero significa que el resultado debe leerse.
con cuidado.
t0-alpha está marcado como sin fugas en GIFT-Eval. Me baso en esa etiqueta de referencia aquí; No inspeccioné de forma independiente todo el corpus de preentrenamiento.
por lo que las fugas no explican la diferencia entre t0-alfa y los principales modelos limpios.
Problemas abiertos en evaluación y diseño de sistemas.
La receta de modelado ahora parece bastante estable. Las preguntas abiertas son cada vez más sobre datos, evaluación, calibración y diseño de sistemas.
Es probable que las próximas ganancias provengan de cinco lugares.
En primer lugar, el control de fugas debe ser más estricto. Los puntos de referencia de pronóstico reutilizan muchos conjuntos de datos públicos, y los conjuntos de preentrenamiento del modelo básico pueden ser amplios. Una tabla de clasificación es tan útil como la separación entre los datos previos al entrenamiento y los datos de prueba.
En segundo lugar, la calibración es importante. Un pronóstico probabilístico no sólo debe situar bien la mediana. Sus cuantiles deberían significar lo que dicen. Si se supera el cuantil 0,9 mucho más o mucho menos del 10% de
En ese momento, el modelo está dando una incertidumbre incorrecta.
En tercer lugar, es probable que los enrutadores y los conjuntos importen más que las clasificaciones de un solo modelo. Los resultados a nivel de tarea sugieren complementariedad entre modelos. Un sistema que sabe cuándo confiar en cada modelo puede vencer a cualquier modelo.
En cuarto lugar, las líneas de base clásicas deben ser más sólidas. ARIMA predeterminado no es lo mismo que la pila de pronósticos optimizada de un profesional. Si los modelos básicos se comparan sólo con líneas de base automáticas débiles, la comparación es incompleta.
Quinto, algunos ámbitos pueden necesitar estimadores especializados. Un modelo básico general es útil cuando el dominio de implementación es amplio o desconocido. Un problema empresarial repetido con una estructura estable puede recompensar a un modelo más pequeño entrenado para esa decisión específica.
El resultado de t0-alfa es útil porque hace visible este cambio. Un modelo pequeño y abierto ahora es lo suficientemente fuerte como para ubicarse cerca de sistemas mucho más grandes. Eso hace que la calidad de la evaluación sea más importante, no menos.
cabezas probabilísticas. Los problemas abiertos ahora están en la evaluación y el diseño del sistema: control de fugas, calibración, líneas de base más sólidas, enrutamiento y ensamblaje.
Estimadores de pronóstico entrenados en simuladores
Hay otra ruta que se sitúa ligeramente fuera de la receta actual del modelo básico de series temporales.
Los LLM de series temporales más recientes aprenden el comportamiento de pronóstico general a partir de grandes corpus de capacitación previa. Esa es la dirección Chronos, TimesFM, Toto, Moirai, TiRex y t0-alpha: recopila muchas series en tiempo real,
entrene un modelo general y espere que la representación se transfiera entre dominios.
El artículo de Simulacrum apunta a un camino diferente pero complementario. En lugar de realizar un entrenamiento previo únicamente con conjuntos de datos históricos, construye un mundo de pronóstico simulado, toma muestras de muchas series temporales sintéticas de ese mundo y entrena un estimador neuronal para tomar la decisión que importa.
Por ejemplo, si el problema de implementación son series cortas de demanda minorista, simule series cortas de demanda minorista. Si el problema son datos de observabilidad de alta frecuencia, simule tendencia, estacionalidad, ráfagas,
desapariciones, interrupciones, cambios de régimen y censura. Luego entrene al estimador para el objetivo real: cuantiles calibrados, costo de inventario, riesgo de capacidad, selección de modelo, reducción de sesgo o robustez.
intervalos de predicción.
Esto no reemplaza los modelos básicos de series temporales. Está más cerca de una fábrica de estimadores. Un modelo básico intenta ser ampliamente competente en muchos dominios desconocidos. Un estimador entrenado en un simulador intenta ser casi óptimo dentro de un mundo cuidadosamente diseñado.
Sin embargo, esto conlleva un riesgo. Si el mundo simulado está equivocado, el modelo puede estar equivocado con seguridad para el problema real. Si el simulador está cerca de la configuración de implementación, el método proporciona
algo atractivo: un pronosticador pequeño, rápido y para tareas específicas cuyo objetivo de capacitación coincide directamente con la decisión comercial.
Para este artículo, el punto es que las próximas ganancias pueden no provenir únicamente de LLM de series temporales más grandes. También pueden provenir de híbridos: modelos básicos para una robustez amplia de tiro cero, modelos clásicos para casos estructurados limpios, enrutadores y conjuntos para complementariedad y estimadores neuronales entrenados en simuladores para problemas repetidos de pronóstico de dominios específicos.
Espacio libre híbrido de guardias y enrutadores
Dado que t0-alfa rara vez pierde frente a Seasonal Naive, revisé dos ideas híbridas simples.
Ambos son análisis de Oracle. Usan la respuesta para elegir el mejor modelo para cada tarea, por lo que son techos en lugar de sistemas desplegables. Los techos siguen siendo útiles porque nos indican dónde está el espacio libre.
existe.
El ingenuo guardia apenas mueve la puntuación, de 0,4941 a 0,4936. Eso es lo que se espera. t0-alpha pierde contra Seasonal Naive solo una vez, por lo que un guardia tiene poco que arreglar.
El resultado del enrutador es más interesante. Un oráculo que selecciona entre t0-alfa y cronos-2 por tarea alcanza 0,4700, mejor que cualquiera de los modelos por separado.
Ese no es un resultado desplegable porque el enrutador usa la respuesta. Es una prueba de complementariedad.
El próximo experimento debería ser un conjunto probabilístico real: promediar los pronósticos cuantiles por serie o aprender un enrutador que no sea de Oracle utilizando metadatos y rendimiento de validación. El número de Oracle nos dice que existe margen de maniobra, pero no nos dice cuánto sobrevive en un sistema real.
ofrece ganancias mucho mayores, lo que sugiere que el ensamblaje y el enrutamiento aprendido son los próximos experimentos más prometedores.
Resumen: dónde aterriza t0-alfa
t0-alfa es un marcador útil de dónde se encuentra ahora el campo. Un modelo abierto 102M puede reproducir los números de referencia informados, superar las líneas de base clásicas en GIFT-Eval y acercarse a varios modelos recientes.
Modelos básicos de series de tiempo sobre CRPS agregados.
No está solo en ese grupo. TiRex es más pequeño y ligeramente por delante en esta comparación, mientras que Toto, Chronos-2 y TimesFM-2.5 también se ubican justo por encima de t0-alfa en CRPS agregado. Las brechas son lo suficientemente pequeñas
que no interpretaría la tabla como un orden preciso. Lo interpretaría como una prueba de que varios modelos básicos de series temporales limpios y modernos funcionan ahora aproximadamente en la misma banda de rendimiento.
Los pequeños modelos básicos de series temporales abiertas ahora son lo suficientemente sólidos como para ser puntos de referencia serios. t0-alpha supera todas las líneas de base clásicas en la tabla GIFT-Eval y pierde ante Seasonal Naive en solo una de las 97 tareas
configuraciones.
Eso no hace que los pronósticos clásicos queden obsoletos. Para obtener datos diarios o mensuales limpios, un modelo clásico bien especificado aún puede ser difícil de superar. Para datos heterogéneos de alta frecuencia, un modelo básico
a menudo se gana el sustento. Para problemas repetidos de dominios específicos, un estimador entrenado en un simulador puede ser la mejor ruta. Para los sistemas de producción, la respuesta útil probablemente sea un enrutador o conjunto en lugar de un modelo de pronóstico universal.
Los próximos experimentos que realizaría son sencillos:
Primero, construya un conjunto de cuantiles reales de t0-alfa y cronos-2. El enrutador de Oracle sugiere complementariedad, pero la prueba útil es cuánto sobrevive sin usar la respuesta para elegir el modelo. En segundo lugar, realizar una evaluación anticipada, controlada por fugas, con líneas de base clásicas más sólidas. La receta del transformador ya no es la única parte interesante del problema; La calidad de la evaluación es igualmente importante. En tercer lugar, probar un estimador especializado capacitado en un simulador en un segmento débil, como los datos de observabilidad de alta frecuencia. Si el simulador captura la estructura correcta, incluidas múltiples estacionales, explosiones, interrupciones, censura y cambios de régimen, la comparación se vuelve más interesante que el modelo básico versus el modelo clásico.
En la práctica, combinaría cuatro cosas: modelos básicos para una competencia amplia de tiro cero, modelos clásicos para casos estructurados limpios, enrutadores aprendidos para la complementariedad y estimadores especializados donde el mundo de implementación se repite lo suficiente como para simularlo.
Descargo de responsabilidad: Los puntos de vista y opiniones expresados en este artículo son míos y no representan los de mi empleador ni los de ninguna organización afiliada. El contenido se basa en la experiencia y la reflexión personal y no debe tomarse como consejo profesional o académico.
📚Referencias
La empresa de pronóstico. (2026). t0-alfa. Tarjeta de modelo de cara abrazada. Describe t0-alpha como un modelo de pronóstico probabilístico multihorizonte basado en transformadores de pesos abiertos y proporciona los pesos del modelo, las instrucciones de uso y el contexto de licencia de Apache-2.0. Aksu, T., Woo, G., Liu, J., Liu, X., Liu, C., Savarese, S., Xiong, C. y Sahoo, D. (2024). GIFT-Eval: un punto de referencia para la evaluación del modelo de pronóstico de series temporales generales. Se presentó GIFT-Eval, el punto de referencia de pronóstico de series temporales de uso general y cero utilizado en este artículo, que incluye su conjunto de tareas multidominio, protocolo de puntuación normalizado y configuración de evaluación con detección de fugas. Das, A., Kong, W., Sen, R. y Zhou, Y. (2024). Un modelo básico exclusivo para decodificador para pronósticos de series temporales. Conferencia Internacional sobre Aprendizaje Automático (ICML). Se presentó TimesFM, un modelo básico de series temporales de decodificador basado únicamente en parches y una de las principales familias de comparadores en la clasificación de GIFT-Eval. Ansari, AF, Stella, L., Turkmen, C., Zhang, X., Mercado, P., Shen, H., Rangapuram, SS, Arango, SP, Kapoor, S., Zschiegner, J., Maddix, DC, Wang, H., Mahoney, MW, Torkkola, K., Wilson, AG, Bohlke-Schneider, M. y Wang, Y. (2024). Chronos: aprendiendo el lenguaje de las series temporales. Se presentó Chronos, que convierte valores de series temporales continuas en tokens discretos y entrena arquitecturas de modelos de lenguaje para pronósticos probabilísticos. Jin, M., Wang, S., Ma, L., Chu, Z., Zhang, JY, Shi, X., Chen, P.-Y., Liang, Y., Li, Y.-F., Pan, S. y Wen, Q. (2024). Time-LLM: Previsión de series temporales mediante la reprogramación de modelos de lenguaje grandes. Conferencia Internacional sobre Representaciones del Aprendizaje (ICLR). Muestra la segunda familia de trabajos de “LLM de series temporales”, donde los LLM de texto previamente entrenados se reprograman para realizar pronósticos en lugar de entrenarse de forma nativa en parches o tokens de series temporales.