Ein einzelnes Bild im Zentrum des Streits um die KI-Blase

Von all den Diagrammen, die in der Debatte darüber kursieren, ob künstliche Intelligenz überhitzt, ist eines zu einer Art Rorschach-Test geworden: eine Linie, die den wöchentlichen Token-Verbrauch auf OpenRouter von etwa 0,5 Billionen im Januar 2025 auf 126,2 Billionen ansteigen lässt – ein Zuwachs von mehr als 25.000 Prozent. Befürworter der Boom-These verweisen auf die nahezu vertikale Steigung als Beweis dafür, dass die Nachfrage real und beschleunigt ist. Skeptiker sehen darin eine Eitelkeitsmetrik, die als Branchenindikator verkleidet wurde.

Beide Lesarten verdienen eine genauere Prüfung. Einer von Matthias Bastian veröffentlichten und auf LinkedIn hervorgehobenen Analyse zufolge lässt sich die OpenRouter-Kurve besser als Geschichte über Messung verstehen denn als Geschichte über Massenakzeptanz oder wirtschaftlichen Wert.

Was OpenRouter misst – und was nicht

OpenRouter ist eine Routing-Schicht: Entwickler nutzen sie, um ihre Anwendungen mit einem Katalog von KI-Modellen mehrerer Anbieter zu verbinden und zwischen ihnen je nach Preis, Geschwindigkeit oder Fähigkeit zu wechseln. Das macht seine Nutzungsdaten wirklich interessant, weil sie Produktionsverkehr erfassen und nicht Benchmark-Ergebnisse. Ein Token ist die grundlegende Einheit der KI-Berechnung – ungefähr das Äquivalent zu einer Gallone Treibstoff für ein Auto oder einer von einem Versorgungsunternehmen abgerechneten Arbeitseinheit.

Das Problem ist, dass Tokens kein Stellvertreter für Nutzer, Sitzungen oder Umsatz sind. Eine Plattform kann dramatisch mehr Tokens verarbeiten und dabei ungefähr dieselbe Anzahl von Menschen bedienen, einfach weil jede Anfrage heute weit mehr Rechenleistung kostet. Diese Kluft zwischen Volumen und Wert liegt im Kern der Blasen-Debatte.

Warum Token-Zahlen so schnell inflationieren

Reasoning-Modelle denken laut

Moderne Reasoning-Modelle erzeugen große Mengen interner „Denk“-Tokens, bevor sie eine endgültige Antwort produzieren. Diese Tokens sind für den Endnutzer unsichtbar und tragen oft nichts zur wahrgenommenen Qualität der Ausgabe bei, werden aber vollständig gezählt. Ein Modell, das ausführlich abwägt, kann den Token-Verbrauch um ein Mehrfaches vervielfachen im Vergleich zu einem einfacheren Modell, das denselben Prompt beantwortet.

Agentische Systeme verbrennen Tokens

Nicht optimierte agentische KI-Systeme verstärken den Effekt weiter. Ein Agent, der plant, Tools aufruft, Ergebnisse prüft und erneut versucht, kann für eine einzige Aufgabe viele Modellaufrufe durchlaufen. Ein marginaler Anstieg der realen Nutzung – ein paar mehr laufende Agenten, ein etwas längerer Workflow – kann sich in einem enormen Anstieg der verbrauchten Tokens niederschlagen. In diesem Sinne spiegelt das OpenRouter-Diagramm teilweise wider, wie ineffizient einige Deployments noch immer sind.

Weekly token usage on OpenRouter has exploded since early 2025. | Image: Peter Walker / OpenRouter
Weekly token usage on OpenRouter has exploded since early 2025. | Image: Peter Walker / OpenRouter

Die Leaderboard-Falle: Die Dominanz von GPT 5.6 Luna

Modell-Rankings auf der Plattform laden zu einer ähnlichen Fehlinterpretation ein. OpenAIs GPT 5.6 Luna dominierte kürzlich den Token-Verbrauch auf OpenRouter, was leicht als Beliebtheitsschub zu deuten ist. Das muss nicht so sein. Ein Modell kann eine Token-Rangliste allein dadurch anführen, dass es mehr Tokens pro Prompt erzeugt, wodurch es beschäftigter wirkt, als es ist. Verbrauchsrankings messen ebenso sehr Ausführlichkeit und Arbeitslast wie Akzeptanz.

Folgen Sie stattdessen dem Umsatz

Wo das Token-Volumen mehrdeutig ist, sind Ausgaben schwerer zu fälschen. Auf der Umsatzseite führt OpenAIs Astra, was darauf hindeutet, dass Kunden bereit sind, für Fähigkeiten an der Spitze des Marktes zu zahlen. Unterdessen expandieren chinesische Modelle, darunter Kimi, GLM und DeepSeek, schnell: Die monatlichen Ausgaben für diese Modelle stiegen 2026 um das Zehnfache, wenn auch von einer viel kleineren Basis aus. Wachstumsraten von einem niedrigen Ausgangspunkt wirken oft spektakulär, und dieser Kontext ist wichtig, wenn die Zahlen als Beleg für einen breiteren Wandel herangezogen werden.

Wie man ein Token-Diagramm liest, ohne in die Irre geführt zu werden

Token-Metriken sind nützlich, aber nur in Verbindung mit den richtigen Fragen:

  • Volumen versus Wert. Fragen Sie, welcher Umsatz oder welche abgeschlossenen Aufgaben hinter den Tokens stehen, nicht nur, wie viele verarbeitet wurden.
  • Tokens pro Anfrage. Steigender Verbrauch kann aus längerem Reasoning statt aus mehr Anfragen resultieren.
  • Modell-Mix. Ein einzelnes ausführliches Modell, das an die Spitze rückt, kann die Kurve verbiegen, ohne die zugrunde liegende Nachfrage zu verändern.
  • Agenten-Overhead. Wiederholungsversuche, Tool-Aufrufe und Planungsschleifen blähen die Zahlen auf und können Ineffizienz verschleiern.
  • Basiseffekte. Zehnfaches Wachstum klingt außergewöhnlich, bis man beachtet, wo es begann.

Die Blasen-Frage bleibt offen

Nichts davon bedeutet, dass der Anstieg bedeutungslos ist. Ein Sprung von 0,5 Billionen auf 126,2 Billionen wöchentliche Tokens zeigt, dass sehr viel KI-Arbeit geleistet wird und dass Entwickler echten Verkehr über eine gemeinsame Plattform leiten. Er zeigt, dass die Inferenz-Ausgaben skalieren. Aber eine beeindruckende Linie in einem Diagramm kann nicht zwischen effizientem Wachstum und teurer Ausuferung unterscheiden, zwischen Millionen von Nutzern und einer Handvoll token-hungriger Agenten.

Die ehrlichste Schlussfolgerung ist, dass das Diagramm die Kosten der Berechnung beschreibt, nicht den Zustand des Marktes. Die Debatte um die KI-Blase wird durch Umsatz, Kundenbindung und Renditen entschieden – die Maße, die Token-Zahlen annähern sollen, aber nicht ersetzen können.

Dieser Artikel basiert auf einer Reportage von The Decoder. Lesen Sie den Originalartikel.

Originally published on the-decoder.com