Googles TimesFM-3 blickt über die Kurve hinaus

Google Research hat TimesFM-3 vorgestellt, ein Prognosemodell, das darauf ausgelegt ist, zukünftige Werte in Zeitreihen vorherzusagen – die geordneten Zahlenströme, die als tägliche Verkaufszahlen, Verkehrszählungen oder Sensorwerte auftauchen – und dabei auch den Kontext zu berücksichtigen, der diese Zahlen umgibt. Die Veröffentlichung markiert einen weiteren Schritt in dem Bestreben, Prognosen zu einer Allzweckfähigkeit zu machen, statt zu einem maßgeschneiderten Engineering-Projekt, das für jeden Datensatz neu aufgebaut wird.

Die zentrale Prämisse ist, dass echte Prognosen selten von einer einzigen Variable abhängen. Google veranschaulicht dies am Beispiel einer Einzelhandelskette, die versucht, den Eisverkauf vorherzusehen. Ein Modell, das nur vergangene Eiskäufe betrachtet, wird vieles übersehen: Verkäufe verwandter Artikel wie Waffeln und Sirup, historische Fußgängerfrequenz in der Nähe des Ladens, Wetterbedingungen, geplante Rabattaktionen und Feiertage prägen alle die Nachfrage. TimesFM-3 ist darauf ausgelegt, diese Signale in einer einzigen Vorhersage zusammenzuführen, statt jedes als separates Problem zu behandeln.

Patches, Normalisierung und ein bidirektionaler Transformer

Architektonisch bleibt TimesFM-3 in der Transformer-Familie, demselben Basisdesign, das auch seine Vorgänger verwendeten. Es trifft jedoch bewusste Entscheidungen darüber, wie Zeitreihendaten in das Netzwerk gelangen. Statt dem Modell einen Datenpunkt nach dem anderen zuzuführen, gruppiert es 32 aufeinanderfolgende Punkte zu einem einzigen Patch. Dieser Patch wird zur Einheit, über die das Modell schlussfolgert, was die Sequenz verkürzt und dem Netzwerk einen breiteren Blick auf die lokale Form gibt.

Google normalisiert außerdem jede Reihe auf eine gemeinsame Skala. Das ist wichtig, weil Zeitreihen in völlig unterschiedlichen Größenordnungen auftreten – eine Handvoll verkaufter Einheiten pro Tag gegenüber Millionen von Messwerten eines industriellen Sensors – und ein direkter Vergleich bedeutungslos wäre. Die Skalierung jeder Reihe auf eine gemeinsame Basis ermöglicht es dem Modell, Muster aus sehr unterschiedlichen Domänen als vergleichbar zu behandeln.

Die Verarbeitung läuft dann in zwei abwechselnden Richtungen. Entlang der Zeitachse sucht das Modell nach Mustern innerhalb einer einzelnen Reihe und stützt sich dabei nur auf vergangene Werte, damit keine zukünftigen Informationen in die Vorhersage gelangen können. Über die Reihen hinweg vergleicht es jede Variable zu einem gegebenen Zeitpunkt und lernt, wie sie zusammenhängen. Diese reihenübergreifende Sicht ist es, die es dem Modell ermöglicht, Effekte wie die Verschiebung des Absatzes eines Produkts durch einen Rabatt auf ein anderes zu erfassen – eine Beziehung, die ein Einzelreihenmodell nie beobachten würde.

Architekturdiagramm von TimesFM-3, das vier Zeitreihen in Patches von jeweils 32 Punkten zeigt, ein Token-Grid bestehend aus kausaler zeitlicher Attention und vollständiger Variablen-Attention sowie die vorhergesagten Zielreihen T1 und T2.
Blau markiert die Zielreihe, Violett eine nur historisch bekannte Variable und Grün ein bekanntes zukünftiges Ereignis, dessen Tokens bereits kommende Patches enthalten. | Bild: Google

Googles Darstellung des Eingabe-Setups färbt die Daten farblich: eine blaue Zielreihe, violette Variablen, die nur aus der Historie bekannt sind, und grüne Tokens für bekannte zukünftige Ereignisse, deren Repräsentation bereits die kommenden Patches enthält.

Drei Arten zusätzlicher Signale

TimesFM-3 akzeptiert laut Google drei verschiedene Arten ergänzender Daten.

  • Kovariaten, die es gemeinsam vorhersagt. Das Modell kann mehrere verwandte Variablen gleichzeitig prognostizieren, etwa die Nachfrage nach verschiedenen Eissorten, statt jede isoliert zu behandeln.
  • Historisch bekannte Variablen. Faktoren wie vergangene Fußgängerfrequenz sind bis zur Gegenwart verfügbar, aber nicht darüber hinaus, und das Modell bezieht sie als Kontext ein.
  • Bekannte zukünftige Ereignisse. Geplante Werbeaktionen, Rabattpläne und Wettervorhersagen sind Ereignisse, deren Zeitpunkt bereits bekannt ist, sodass das Modell sie als vorausschauende Eingaben nutzen kann, statt sie allein aus der Historie abzuleiten.

In dieser dritten Kategorie unterscheidet sich TimesFM-3 am deutlichsten von der klassischen statistischen Prognose. Ein Aktionskalender ist kein Muster, das darauf wartet, entdeckt zu werden – er ist eine Tatsache über die Zukunft. Dieses Modell ist darauf ausgelegt, solche Tatsachen als Eingabe zu akzeptieren.

Ein Schuss statt Schritt für Schritt

Frühere Versionen des Modells erzeugten Vorhersagen Block für Block. Jeder neue Block baute auf der vorherigen Vorhersage auf, ein Ansatz, den Google als langsam, rechenintensiv und anfällig für sich kumulierende Fehler beschreibt: Ein kleiner Fehler früh in der Sequenz konnte alles Folgende verzerren. Dies ist ein bekanntes Fehlermuster bei autoregressiver Prognose, bei der sich ein Modell effektiv von seiner eigenen Ausgabe ernährt.

TimesFM-3 verlässt diese Schleife. Es weist jedem zukünftigen Zeitschritt leere Platzhalter zu und füllt sie in einem einzigen Durchgang aus. Google bezeichnet dies als One-Shot-Prognose, und der praktische Unterschied zeigt sich im Eis-Szenario. Ein Modell, das nur vergangene Verkäufe kennt, wird einfach den etablierten wöchentlichen Rhythmus fortsetzen, blind für eine Werbeaktion, die noch nicht stattgefunden hat. Sobald TimesFM-3 den Rabattplan erhält, kann es die Prognose in einem einzigen Durchgang anpassen, statt sich Schritt für Schritt vorwärtszubewegen.

Neun Werte pro Schritt: Unsicherheit eingebaut

Statt für jeden Zeitschritt eine einzelne Punktschätzung auszugeben, liefert TimesFM-3 neun Werte pro Schritt. Diese Werte sollen die Bandbreite und Unsicherheit der Vorhersage erfassen – eine Prognose, die nicht nur vermittelt, was wahrscheinlich passieren wird, sondern auch, wie sicher sich das Modell ist. Für Planungszwecke ist diese Unterscheidung oft nützlicher als eine nackte Zahl, weil sie nachgelagerten Systemen erlaubt, über Risiken zu schlussfolgern, Bestände zu puffern oder Kapazitäten freizuhalten.

Streudiagramm für den Gift-Eval-Benchmark, das den durchschnittlichen Rang für Punkt- und Wahrscheinlichkeitsprognosen zeigt; TimesFM-3 ist in Orange unten links dargestellt, vor Chronos-2, Toto-2.0, TiRex-2 und TimesFM-2.5.
Unten links ist besser. TimesFM-3 führt Gift-Eval mit großem Abstand an, selbst wenn es auf eine einzige Variable beschränkt ist. | Bild: Google

Trainiert im Billionen-Punkte-Maßstab, eingesetzt im Zero-Shot-Modus

Das Modell hat 330 Millionen Parameter und wurde laut Google auf einer Mischung aus realen und synthetischen Zeitreihen mit insgesamt mehr als einer Billion Datenpunkten trainiert. Wie seine Vorgänger arbeitet es Zero-Shot: Es erfordert kein zusätzliches Training für eine neue Aufgabe. Diese Eigenschaft ist zentral für das Versprechen. Statt einen annotierten Datensatz zusammenzustellen und für jedes neue Prognoseproblem ein Modell anzupassen, kann ein Anwender TimesFM-3 auf eine Reihe und die zugehörigen Signale richten und brauchbare Ergebnisse erwarten.

Die Zero-Shot-Leistung ist auch das, was einen Foundation-Model-Ansatz für Prognosen überhaupt attraktiv macht. Prognoseprobleme gibt es überall – Bestandsführung, Energielast, Personalplanung, Logistik, Kapazitätsplanung –, aber jedes erforderte historisch seine eigene Pipeline, seine eigenen Features und sein eigenes Validierungsregime. Ein einziges Modell, das über sie hinweg generalisiert, verändert, wer ein Prognosesystem bauen kann und wie schnell.

Die Breite der Trainingsdaten ist hier ebenso wichtig wie die Parameterzahl. Indem Google synthetische Reihen mit realen mischt, kann es das Modell einer größeren Vielfalt an Formen, saisonalen Rhythmen und Schockmustern aussetzen, als eine einzelne Domäne liefern könnte. Diese Vielfalt ist der Rohstoff für Generalisierung, und auf ihr beruht letztlich die Zero-Shot-Behauptung.

Die breitere Wette auf Foundation Models für Zahlen

TimesFM-3 liegt an der Schnittstelle zweier Trends: der Skalierung von Foundation Models über Text und Bilder hinaus und der seit Langem bestehenden Nachfrage nach besserer operativer Prognose. Googles Rahmung ist, dass Kontext das ist, was eine naive Extrapolation von einer nützlichen Vorhersage trennt, und die Architektur ist eine direkte Antwort auf diese Behauptung – Patches für Effizienz, Normalisierung für Vergleichbarkeit, Attention über Zeit und Variablen hinweg für Beziehungen und ein One-Shot-Decoder für Kohärenz.

Ob diese Kombination über unruhige reale Daten hinweg standhält, bleibt die offene Frage, wie bei jedem Zero-Shot-System. Doch die Richtung ist klar: Prognose wird weniger als statistische Pflichtübung und mehr als allgemeine Schlussfolgerungsaufgabe behandelt, bei der Verkaufsdaten, Wetter und ein Rabattkalender alle in dieselbe Eingabe gehören. Für Einzelhändler, die Werbeaktionen durchführen, Versorger, die Last ausgleichen, und Betreiber, die Kapazitäten planen, ist der Reiz unkompliziert – das Modell wird gebeten, Ereignisse zu antizipieren, die bereits im Kalender stehen, und nicht bloß die Linie des letzten Jahres zu verlängern.

Dieser Artikel basiert auf einer Berichterstattung von The Decoder. Lesen Sie den Originalartikel.

Originally published on the-decoder.com