Une seule image au cœur du débat sur la bulle de l'IA

Parmi tous les graphiques qui circulent dans le débat sur la question de savoir si l'intelligence artificielle est en surchauffe, l'un est devenu une sorte de test de Rorschach : une courbe montrant la consommation hebdomadaire de tokens sur OpenRouter grimpant d'environ 0,5 billion en janvier 2025 à 126,2 billions — une augmentation de plus de 25 000 %. Les partisans de la thèse du boom pointent cette pente quasi verticale comme preuve que la demande est réelle et s'accélère. Les sceptiques y voient une métrique de vanité déguisée en indicateur sectoriel.

Les deux lectures méritent un examen attentif. Selon l'analyse publiée par Matthias Bastian et mise en avant sur LinkedIn, la courbe d'OpenRouter se comprend mieux comme une histoire de mesure que comme une histoire d'adoption massive ou de valeur économique.

Ce qu'OpenRouter mesure — et ce qu'il ne mesure pas

OpenRouter est une couche de routage : les développeurs l'utilisent pour connecter leurs applications à un catalogue de modèles d'IA provenant de multiples fournisseurs, en basculant souvent entre eux en fonction du prix, de la vitesse ou des capacités. Cela rend ses données d'utilisation réellement intéressantes, car elles capturent le trafic de production plutôt que les scores de benchmark. Un token est l'unité fondamentale du calcul d'IA — à peu près l'équivalent d'un gallon de carburant pour une voiture, ou d'une unité de travail facturée par un service public.

Le problème est que les tokens ne sont pas un proxy pour les utilisateurs, les sessions ou les revenus. Une plateforme peut traiter dramatiquement plus de tokens tout en servant à peu près le même nombre de personnes, simplement parce que chaque requête coûte désormais bien plus de calcul. Cet écart entre volume et valeur se situe au cœur de l'argument de la bulle.

Pourquoi les comptes de tokens s'enflent si vite

Les modèles de raisonnement pensent à voix haute

Les modèles de raisonnement modernes génèrent de grands volumes de tokens de « réflexion » internes avant de produire une réponse finale. Ces tokens sont invisibles pour l'utilisateur final et n'ajoutent souvent rien à la qualité perçue du résultat, mais ils sont comptés intégralement. Un modèle qui délibère longuement peut multiplier plusieurs fois la consommation de tokens par rapport à un modèle plus simple répondant à la même invite.

Les systèmes agentiques brûlent des tokens

Les systèmes d'IA agentiques non optimisés amplifient encore l'effet. Un agent qui planifie, appelle des outils, vérifie les résultats et réessaie peut enchaîner de nombreux appels de modèle pour une seule tâche. Une augmentation marginale de l'usage réel — quelques agents de plus en fonctionnement, un flux de travail légèrement plus long — peut se traduire par un pic énorme de tokens consommés. En ce sens, le graphique d'OpenRouter reflète en partie l'inefficacité de certains déploiements.

L'utilisation hebdomadaire de tokens sur OpenRouter a explosé depuis début 2025. | Image : Peter Walker / OpenRouter
L'utilisation hebdomadaire de tokens sur OpenRouter a explosé depuis début 2025. | Image : Peter Walker / OpenRouter

Le piège du classement : la domination de GPT 5.6 Luna

Les classements de modèles sur la plateforme invitent à une mauvaise lecture similaire. GPT 5.6 Luna d'OpenAI a récemment dominé la consommation de tokens sur OpenRouter, ce qu'il est facile d'interpréter comme un pic de popularité. Ce n'est peut-être pas le cas. Un modèle peut arriver en tête d'un graphique de tokens simplement en générant plus de tokens par invite, ce qui le fait paraître plus sollicité qu'il ne l'est. Les classements de consommation mesurent la verbosité et la charge de travail autant que l'adoption.

Suivez plutôt les revenus

Là où le volume de tokens est ambigu, les dépenses sont plus difficiles à falsifier. Du côté des revenus, Astra d'OpenAI mène la danse, ce qui suggère que les clients sont prêts à payer pour la capacité au sommet du marché. Parallèlement, des modèles chinois, notamment Kimi, GLM et DeepSeek, se développent rapidement : les dépenses mensuelles sur ces modèles ont été multipliées par dix en 2026, bien qu'à partir d'une base beaucoup plus petite. Les taux de croissance à partir d'un point de départ bas ont tendance à paraître spectaculaires, et ce contexte compte lorsque les chiffres sont utilisés comme preuve d'un changement plus large.

Comment lire un graphique de tokens sans se laisser tromper

Les métriques de tokens sont utiles, mais seulement lorsqu'elles sont associées aux bonnes questions :

  • Volume contre valeur. Demandez quels revenus ou quelles tâches accomplies se cachent derrière les tokens, et pas seulement combien ont été traités.
  • Tokens par requête. Une consommation en hausse peut provenir d'un raisonnement plus long plutôt que de plus de requêtes.
  • Composition des modèles. Un seul modèle verbeux accédant à la première place peut courber la courbe sans changer la demande sous-jacente.
  • Surcoût des agents. Les nouvelles tentatives, les appels d'outils et les boucles de planification gonflent les comptes et peuvent masquer l'inefficacité.
  • Effets de base. Une croissance décuplée semble extraordinaire jusqu'à ce que l'on note d'où elle est partie.

La question de la bulle reste ouverte

Rien de tout cela ne signifie que la flambée est dénuée de sens. Un bond de 0,5 billion à 126,2 billions de tokens hebdomadaires montre qu'une grande quantité de travail d'IA est réalisée, et que les développeurs acheminent du trafic réel via une plateforme partagée. Cela montre que les dépenses d'inférence augmentent. Mais une courbe impressionnante sur un graphique ne permet pas de distinguer une croissance efficace d'un étalement coûteux, ni des millions d'utilisateurs d'une poignée d'agents avides de tokens.

La conclusion la plus honnête est que le graphique décrit le coût du calcul, non l'état du marché. Le débat sur la bulle de l'IA sera tranché par les revenus, la rétention et les rendements — les mesures que les comptes de tokens sont censés approcher mais ne peuvent remplacer.

Cet article est basé sur un reportage de The Decoder. Lire l'article original.

Originally published on the-decoder.com