Google AI lanza TimesFM-3: un modelo básico de disparo cero de parámetros de 330 millones para pronósticos de series temporales multivariadas

Google Research ha lanzado TimesFM-3, un modelo básico de series temporales de 330 millones de parámetros que pronostica múltiples series relacionadas en un solo paso hacia adelante. Cada punto de control del TimesFM hasta la versión 2.5 era univariante: una serie, su propia historia, nada más. TimesFM-3 está preparado previamente de forma nativa para pronósticos multivariados en más de 1 billón de puntos de tiempo y acepta múltiples objetivos, covariables pasadas y covariables pasadas y futuras sin ningún ajuste específico de la tarea. Ocupa el puesto promedio más alto entre los modelos básicos previamente entrenados en GIFT-Eval, fev-bench y la tabla de clasificación TIME, tanto en métricas puntuales como probabilísticas.

¿Es desplegable?

Parcial, el código del repositorio de TimesFM es Apache-2.0, pero los pesos de TimesFM 3.0 se envían bajo timesfm-non-commercial-license-v1.0. Están restringidos a un uso no comercial y no productivo. Puedes compararlo hoy. No puede enviarlo detrás de una API de pronóstico de producción.

que cambio

Cada versión de TimesFM hasta la 2.5 fue univariante. Pronosticó una serie de su propia historia. La mayoría de los problemas reales de previsión no tienen esa forma. El ejemplo de Google son las ventas de helados, donde las ventas de productos relacionados, el tráfico peatonal, el clima, las promociones y los días festivos mueven el objetivo.

TimesFM-3 está preentrenado de forma nativa para pronósticos multivariados. Lleva 330 millones de parámetros y fue entrenado previamente en más de 1 billón de puntos temporales de series reales y sintéticas. Tres tipos de entrada funcionan sin problemas, sin ajustes específicos de la tarea:

Múltiples objetivos pronostican de manera conjunta, con resultados puntuales y cuantiles para cada uno. Covariables pasadas, conocidas sólo históricamente, como el tráfico peatonal en el pasado. Covariables pasado-futuro, cuyos valores futuros se conocen, como un calendario de promoción.

Arquitectura: parches, luego dos tipos de atención

La columna vertebral sigue siendo un transformador exclusivo para decodificador. Los puntos contiguos se agrupan en parches de 32 pasos y luego se normalizan por series para que no dominen escalas muy diferentes. Los tokens de covariable objetivo y pasado provienen de un único parche. Los tokens de covariables pasado-futuro utilizan un truco de anticipación: el parche actual se concatena con parches futuros, por lo que el modelo ve los eventos programados antes de que ocurran.

Luego, las fichas ingresan a una cuadrícula 2D y pasan a través de dos mecanismos de atención alternos:

La atención temporal causal discurre horizontalmente. Es estrictamente causal y se limita a tokens anteriores dentro de la misma serie, lo que bloquea la fuga. La atención variada completa se ejecuta verticalmente. En un paso de tiempo determinado, un token lee cada dos series en ese paso, aprendiendo correlaciones entre series.

Un pase hacia delante en lugar de muchos

Las versiones anteriores de TimesFM decodificaban un parche a la vez. Eso agrega latencia, costo de cómputo y error compuesto. TimesFM-3 utiliza Contiguous Patch Masking, la estrategia de enmascaramiento de tiempo de entrenamiento introducida con TiRex. Se añaden tokens de marcador de posición enmascarados para todo el horizonte. Allí se enmascaran los objetivos y las covariables pasadas. Las covariables pasado-futuro siguen siendo visibles, por lo que las señales futuras conocidas aún llegan al modelo. Las capas de atención alternas llenan simultáneamente cada parche de horizonte enmascarado. Cada objetivo recibe 9 cuantiles, del percentil 10 al 90, en cada paso del horizonte.

Puntos de referencia

Google evaluó en GIFT-Eval, fev-bench y la tabla de clasificación TIME, frente a Chronos-2, la familia Toto 2.0 y TimesFM-2.5. Entre los modelos básicos previamente entrenados, TimesFM-3 ocupa el puesto promedio más alto en los tres, tanto para métricas puntuales como probabilísticas. Las notas de la versión del paquete registran el puesto número 1 en general en fev-bench en 100 tareas del mundo real, el puesto número 1 en general en TIME en 50 conjuntos de datos de dominio y 98 tareas de evaluación, y el puesto número 1 entre los modelos básicos en GIFT-Eval.

Explicador interactivo