Uma única imagem no centro da disputa sobre a bolha da IA
De todos os gráficos que circulam no debate sobre se a inteligência artificial está superaquecendo, um se tornou uma espécie de teste de Rorschach: uma linha mostrando o consumo semanal de tokens na OpenRouter subindo de aproximadamente 0,5 trilhão em janeiro de 2025 para 126,2 trilhões — um aumento de mais de 25.000 por cento. Os defensores da tese do boom apontam para a inclinação quase vertical como prova de que a demanda é real e está acelerando. Os céticos veem uma métrica de vaidade disfarçada de indicador do setor.
Ambas as leituras merecem escrutínio. De acordo com uma análise publicada por Matthias Bastian e destacada no LinkedIn, a curva da OpenRouter é melhor entendida como uma história sobre medição do que como uma história sobre adoção em massa ou valor econômico.
O que a OpenRouter mede — e o que não mede
A OpenRouter é uma camada de roteamento: desenvolvedores a usam para conectar seus aplicativos a um catálogo de modelos de IA de vários provedores, muitas vezes alternando entre eles com base em preço, velocidade ou capacidade. Isso torna seus dados de uso genuinamente interessantes, porque capturam tráfego de produção em vez de pontuações de benchmark. Um token é a unidade fundamental de computação de IA — aproximadamente o equivalente a um galão de combustível para um carro, ou uma unidade de trabalho cobrada por uma concessionária.
O problema é que tokens não são um proxy para usuários, sessões ou receita. Uma plataforma pode processar dramaticamente mais tokens enquanto atende aproximadamente o mesmo número de pessoas, simplesmente porque cada solicitação agora custa muito mais computação. Essa lacuna entre volume e valor está no cerne do argumento da bolha.
Por que as contagens de tokens inflam tão rapidamente
Modelos de raciocínio pensam em voz alta
Modelos de raciocínio modernos geram grandes volumes de tokens internos de "pensamento" antes de produzir uma resposta final. Esses tokens são invisíveis para o usuário final e muitas vezes não acrescentam nada à qualidade percebida da saída, mas são contados integralmente. Um modelo que delibera longamente pode multiplicar o consumo de tokens várias vezes em comparação com um modelo mais simples respondendo ao mesmo prompt.
Sistemas agênticos consomem tokens vorazmente
Sistemas de IA agênticos não otimizados amplificam ainda mais o efeito. Um agente que planeja, chama ferramentas, verifica resultados e tenta novamente pode percorrer muitas chamadas de modelo para uma única tarefa. Um aumento marginal no uso do mundo real — alguns agentes a mais em execução, um fluxo de trabalho um pouco mais longo — pode se traduzir em um pico enorme de tokens consumidos. Nesse sentido, o gráfico da OpenRouter reflete em parte o quão ineficientes algumas implantações ainda são.

A armadilha do ranking: o domínio do GPT 5.6 Luna
Os rankings de modelos na plataforma convidam a uma leitura equivocada semelhante. O GPT 5.6 Luna, da OpenAI, recentemente dominou o consumo de tokens na OpenRouter, o que é fácil de interpretar como um aumento de popularidade. Pode não ser. Um modelo pode liderar um gráfico de tokens simplesmente gerando mais tokens por prompt, o que o faz parecer mais movimentado do que é. Os rankings de consumo medem verbosidade e carga de trabalho tanto quanto adoção.
Siga a receita em vez disso
Onde o volume de tokens é ambíguo, os gastos são mais difíceis de falsificar. Do lado da receita, o Astra da OpenAI lidera, sugerindo que os clientes estão dispostos a pagar por capacidade no topo do mercado. Enquanto isso, modelos chineses, incluindo Kimi, GLM e DeepSeek, estão se expandindo rapidamente: os gastos mensais com esses modelos aumentaram dez vezes em 2026, embora a partir de uma base muito menor. Taxas de crescimento a partir de um ponto de partida baixo tendem a parecer espetaculares, e esse contexto importa quando os números são usados como evidência de uma mudança mais ampla.
Como ler um gráfico de tokens sem ser enganado
Métricas de tokens são úteis, mas apenas quando combinadas com as perguntas certas:
- Volume versus valor. Pergunte qual receita ou tarefas concluídas estão por trás dos tokens, não apenas quantos foram processados.
- Tokens por solicitação. O consumo crescente pode vir de raciocínio mais longo em vez de mais solicitações.
- Mix de modelos. Um único modelo verboso entrando no topo pode distorcer a curva sem alterar a demanda subjacente.
- Sobrecarga de agentes. Novas tentativas, chamadas de ferramentas e loops de planejamento inflam as contagens e podem mascarar ineficiência.
- Efeitos de base. Um crescimento de dez vezes parece extraordinário até você notar de onde partiu.
A questão da bolha permanece em aberto
Nada disso significa que o aumento não tenha sentido. Um salto de 0,5 trilhão para 126,2 trilhões de tokens semanais mostra que uma grande quantidade de trabalho de IA está sendo feita, e que os desenvolvedores estão roteando tráfego real por uma plataforma compartilhada. Mostra que os gastos com inferência estão escalando. Mas uma linha impressionante em um gráfico não consegue distinguir entre crescimento eficiente e expansão cara, entre milhões de usuários e um punhado de agentes famintos por tokens.
A conclusão mais honesta é que o gráfico descreve o custo da computação, não o estado do mercado. O debate sobre a bolha da IA será resolvido por receita, retenção e retornos — as medidas que as contagens de tokens pretendem aproximar, mas não podem substituir.
Este artigo é baseado em reportagem do The Decoder. Leia o artigo original.
Originally published on the-decoder.com






