TimesFM-3 de Google regarde au-delà de la courbe

Google Research a présenté TimesFM-3, un modèle de prévision conçu pour prédire les valeurs futures de séries temporelles — ces flux ordonnés de chiffres qui apparaissent sous forme de ventes quotidiennes, de comptages de trafic ou de relevés de capteurs — tout en tenant compte du contexte qui entoure ces chiffres. Cette publication marque une nouvelle étape dans la volonté de faire de la prévision une capacité polyvalente plutôt qu'un projet d'ingénierie sur mesure reconstruit pour chaque jeu de données.

La prémisse centrale est que les prévisions réelles reposent rarement sur une seule variable. Google illustre ce point avec une chaîne de magasins cherchant à anticiper ses ventes de glaces. Un modèle qui ne regarde que les achats passés de glaces passera à côté de beaucoup de choses : les ventes d'articles associés comme les gaufrettes et le sirop, la fréquentation historique près du magasin, les conditions météorologiques, les campagnes de remise prévues et les jours fériés façonnent tous la demande. TimesFM-3 est conçu pour intégrer ces signaux dans une seule prédiction au lieu de traiter chacun comme un problème distinct.

Patchs, normalisation et un Transformer bidirectionnel

Sur le plan architectural, TimesFM-3 reste dans la famille des Transformers, la même conception de base que celle utilisée par ses prédécesseurs. Mais il fait des choix délibérés sur la manière dont les données de séries temporelles entrent dans le réseau. Plutôt que d'alimenter le modèle un point de données à la fois, il regroupe 32 points consécutifs en un seul patch. Ce patch devient l'unité sur laquelle le modèle raisonne, ce qui raccourcit la séquence et donne au réseau une vue plus large de la forme locale.

Google normalise également chaque série sur une échelle commune. Cela compte parce que les séries temporelles arrivent avec des ordres de grandeur très différents — quelques unités vendues par jour contre des millions de relevés d'un capteur industriel — et les comparer directement n'aurait aucun sens. Mettre chaque série à l'échelle sur une base partagée permet au modèle de traiter des motifs issus de domaines très différents comme comparables.

Le traitement s'effectue ensuite dans deux directions alternées. Le long de l'axe temporel, le modèle traque des motifs au sein d'une même série, et il ne s'appuie que sur les valeurs passées afin que l'information future ne puisse pas fuiter dans la prédiction. Entre les séries, il compare chaque variable à un instant donné et apprend comment elles sont liées. Cette vue inter-séries est ce qui permet au modèle de détecter des effets tels qu'une remise sur un produit modifiant les ventes d'un autre — une relation qu'un modèle à série unique n'observerait jamais.

Architectural diagram of TimesFM-3, showing four time series in patches of 32 points each, a token grid consisting of causal temporal attention and full variate attention, and the predicted target series T1 and T2.
Blue marks the target series, purple a variable known only historically, and green a known future event whose tokens already include upcoming patches. | Image: Google

L'illustration de Google de la configuration d'entrée code les données par couleur : une série cible en bleu, des variables connues uniquement dans l'historique en violet, et des tokens verts pour les événements futurs connus dont la représentation inclut déjà les patchs à venir.

Trois saveurs de signal supplémentaire

TimesFM-3 accepte trois types distincts de données supplémentaires, selon Google.

  • Les covariables qu'il prédit conjointement. Le modèle peut prévoir plusieurs variables liées à la fois, comme la demande pour différentes saveurs de glace, plutôt que de traiter chacune isolément.
  • Les variables connues historiquement. Des facteurs comme la fréquentation passée sont disponibles jusqu'au présent mais pas au-delà, et le modèle les intègre comme contexte.
  • Les événements futurs connus. Les promotions prévues, les calendriers de remise et les prévisions météorologiques sont des événements dont le moment est déjà connu, de sorte que le modèle peut les utiliser comme entrées prospectives plutôt que de les déduire du seul historique.

C'est dans cette troisième catégorie que TimesFM-3 s'écarte le plus nettement de la prévision statistique classique. Un calendrier de promotions n'est pas un motif en attente d'être découvert — c'est un fait concernant l'avenir. Ce modèle est conçu pour accepter de tels faits en entrée.

Une seule passe au lieu d'étape par étape

Les versions antérieures du modèle généraient les prédictions bloc par bloc. Chaque nouveau bloc était construit sur la prédiction précédente, une approche que Google décrit comme lente, gourmande en calcul et vulnérable à l'accumulation d'erreurs : une petite erreur en début de séquence pouvait fausser tout ce qui suivait. C'est un mode de défaillance bien connu en prévision autorégressive, où un modèle se nourrit en pratique de sa propre sortie.

TimesFM-3 abandonne cette boucle. Il attribue des espaces réservés vides à chaque étape temporelle future et les complète en un seul balayage. Google présente cela comme de la prévision en une seule passe, et la différence pratique apparaît dans le scénario des glaces. Un modèle qui ne connaît que les ventes passées se contentera de poursuivre le rythme hebdomadaire établi, aveugle à une promotion qui n'a pas encore eu lieu. Une fois que TimesFM-3 reçoit le calendrier de remise, il peut ajuster la prévision en une seule passe plutôt que d'avancer incrément par incrément.

Neuf valeurs par étape : l'incertitude intégrée

Au lieu d'émettre une seule estimation ponctuelle pour chaque étape temporelle, TimesFM-3 produit neuf valeurs par étape. Ces valeurs sont destinées à capturer l'étendue et l'incertitude de la prédiction — une prévision qui transmet non seulement ce qui est susceptible de se produire, mais aussi le degré de confiance du modèle. Pour la planification, cette distinction est souvent plus utile qu'un simple chiffre, car elle permet aux systèmes en aval de raisonner sur le risque, de constituer des stocks tampons ou de prévoir de la capacité supplémentaire.

Scatter plot for the Gift-Eval benchmark showing the average rank for point and probability forecasts; TimesFM-3 is shown in orange at the bottom left, ahead of Chronos-2, Toto-2.0, TiRex-2, and TimesFM-2.5.
Lower left is better. TimesFM-3 leads Gift-Eval by a wide margin, even when limited to a single variable. | Image: Google

Entraîné à l'échelle du billion de points, déployé en zero-shot

Le modèle compte 330 millions de paramètres et a été entraîné sur un mélange de séries temporelles réelles et synthétiques totalisant plus d'un billion de points de données, selon Google. Comme ses prédécesseurs, il fonctionne en zero-shot : il ne nécessite aucun entraînement supplémentaire pour une nouvelle tâche. Cette propriété est au cœur de l'argumentaire. Plutôt que d'assembler un jeu de données étiqueté et d'ajuster un modèle pour chaque nouveau problème de prévision, un praticien peut pointer TimesFM-3 vers une série et ses signaux associés et s'attendre à une sortie exploitable.

La performance zero-shot est aussi ce qui rend une approche par modèle de fondation pour la prévision attrayante en premier lieu. Les problèmes de prévision sont partout — stocks, charge énergétique, effectifs, logistique, planification de capacité — mais chacun exigeait historiquement son propre pipeline, ses propres caractéristiques et son propre régime de validation. Un modèle unique qui généralise à travers tous ces cas change qui peut construire un système de prévision et à quelle vitesse.

L'étendue des données d'entraînement compte ici autant que le nombre de paramètres. En mélangeant des séries synthétiques à des séries réelles, Google peut exposer le modèle à une plus grande variété de formes, de rythmes saisonniers et de schémas de chocs qu'aucun domaine unique ne pourrait fournir. Cette diversité est la matière première de la généralisation, et c'est sur elle que repose en dernière analyse l'affirmation zero-shot.

Le pari plus large sur les modèles de fondation pour les nombres

TimesFM-3 se situe à l'intersection de deux tendances : la montée en puissance des modèles de fondation au-delà du texte et des images, et la demande de longue date pour une meilleure prévision opérationnelle. Le cadrage de Google est que le contexte est ce qui sépare une extrapolation naïve d'une prédiction utile, et l'architecture est une réponse directe à cette affirmation — des patchs pour l'efficacité, une normalisation pour la comparabilité, une attention à la fois sur le temps et les variables pour les relations, et un décodeur en une seule passe pour la cohérence.

Savoir si cette combinaison tient le coup face à des données réelles désordonnées reste la question ouverte, comme pour tout système zero-shot. Mais la direction est claire : la prévision est traitée moins comme une corvée statistique et plus comme une tâche de raisonnement général, dans laquelle les données de ventes, la météo et un calendrier de remises ont tous leur place dans la même entrée. Pour les détaillants qui mènent des promotions, les services publics qui équilibrent la charge et les opérateurs qui planifient leur capacité, l'attrait est simple — on demande au modèle d'anticiper des événements déjà inscrits au calendrier, et non simplement de prolonger la courbe de l'an dernier.

Cet article est basé sur un reportage de The Decoder. Lire l'article original.

Originally published on the-decoder.com