Una sola imagen en el centro de la disputa sobre la burbuja de la IA

De todos los gráficos que circulan en el debate sobre si la inteligencia artificial se está sobrecalentando, uno se ha convertido en una especie de test de Rorschach: una línea que muestra el consumo semanal de tokens en OpenRouter subiendo de aproximadamente 0,5 billones en enero de 2025 a 126,2 billones, un aumento de más del 25.000 por ciento. Los partidarios de la tesis del auge señalan la pendiente casi vertical como prueba de que la demanda es real y se está acelerando. Los escépticos ven una métrica de vanidad disfrazada de indicador sectorial.

Ambas lecturas merecen escrutinio. Según el análisis publicado por Matthias Bastian y destacado en LinkedIn, la curva de OpenRouter se entiende mejor como una historia sobre la medición que como una historia sobre la adopción masiva o el valor económico.

Qué mide OpenRouter y qué no

OpenRouter es una capa de enrutamiento: los desarrolladores la usan para conectar sus aplicaciones a un catálogo de modelos de IA de múltiples proveedores, a menudo alternando entre ellos según el precio, la velocidad o la capacidad. Eso hace que sus datos de uso sean genuinamente interesantes, porque capturan tráfico de producción en lugar de puntuaciones de benchmarks. Un token es la unidad fundamental de cómputo de IA, aproximadamente el equivalente a un galón de combustible para un automóvil, o a una unidad de trabajo facturada por una empresa de servicios públicos.

El problema es que los tokens no son un proxy de usuarios, sesiones o ingresos. Una plataforma puede procesar drásticamente más tokens mientras atiende aproximadamente al mismo número de personas, simplemente porque cada solicitud ahora cuesta mucha más computación. Esa brecha entre volumen y valor está en el centro del argumento de la burbuja.

Por qué los recuentos de tokens se inflan tan rápido

Los modelos de razonamiento piensan en voz alta

Los modelos de razonamiento modernos generan grandes volúmenes de tokens internos de "pensamiento" antes de producir una respuesta final. Esos tokens son invisibles para el usuario final y a menudo no aportan nada a la calidad percibida de la salida, pero se cuentan en su totalidad. Un modelo que delibera largamente puede multiplicar varias veces el consumo de tokens en comparación con un modelo más simple que responde al mismo prompt.

Los sistemas agénticos consumen tokens a mansalva

Los sistemas de IA agéntica no optimizados amplifican aún más el efecto. Un agente que planifica, llama a herramientas, verifica resultados y reintenta puede recorrer muchas llamadas al modelo para una sola tarea. Un aumento marginal en el uso real —unos pocos agentes más en ejecución, un flujo de trabajo un poco más largo— puede traducirse en un pico enorme de tokens consumidos. En ese sentido, el gráfico de OpenRouter refleja en parte lo ineficientes que siguen siendo algunos despliegues.

Weekly token usage on OpenRouter has exploded since early 2025. | Image: Peter Walker / OpenRouter
Weekly token usage on OpenRouter has exploded since early 2025. | Image: Peter Walker / OpenRouter

La trampa de la tabla de clasificación: el dominio de GPT 5.6 Luna

Las clasificaciones de modelos en la plataforma invitan a una mala interpretación similar. GPT 5.6 Luna de OpenAI dominó recientemente el consumo de tokens en OpenRouter, lo que es fácil de interpretar como un aumento de popularidad. Puede que no lo sea. Un modelo puede encabezar un gráfico de tokens simplemente generando más tokens por prompt, lo que lo hace parecer más ocupado de lo que está. Las clasificaciones de consumo miden la verbosidad y la carga de trabajo tanto como la adopción.

Mejor siga los ingresos

Donde el volumen de tokens es ambiguo, el gasto es más difícil de falsificar. Del lado de los ingresos, Astra de OpenAI lidera, lo que sugiere que los clientes están dispuestos a pagar por capacidad en la cima del mercado. Mientras tanto, los modelos chinos, incluidos Kimi, GLM y DeepSeek, se están expandiendo rápidamente: el gasto mensual en esos modelos se multiplicó por diez en 2026, aunque desde una base mucho más pequeña. Las tasas de crecimiento desde un punto de partida bajo tienden a parecer espectaculares, y ese contexto importa cuando los números se usan como evidencia de un cambio más amplio.

Cómo leer un gráfico de tokens sin dejarse engañar

Las métricas de tokens son útiles, pero solo cuando se combinan con las preguntas correctas:

  • Volumen versus valor. Pregunte qué ingresos o tareas completadas hay detrás de los tokens, no solo cuántos se procesaron.
  • Tokens por solicitud. El consumo creciente puede provenir de un razonamiento más largo en lugar de más solicitudes.
  • Mezcla de modelos. Un solo modelo verboso que entra en el primer puesto puede torcer la curva sin cambiar la demanda subyacente.
  • Sobrecarga de los agentes. Los reintentos, las llamadas a herramientas y los bucles de planificación inflan los recuentos y pueden enmascarar ineficiencias.
  • Efectos de base. Un crecimiento diez veces mayor suena extraordinario hasta que se observa desde dónde partió.

La pregunta de la burbuja sigue abierta

Nada de esto significa que el aumento carezca de sentido. Un salto de 0,5 billones a 126,2 billones de tokens semanales muestra que se está haciendo una gran cantidad de trabajo de IA, y que los desarrolladores están enrutando tráfico real a través de una plataforma compartida. Muestra que el gasto en inferencia está escalando. Pero una línea impresionante en un gráfico no puede distinguir entre crecimiento eficiente y expansión costosa, entre millones de usuarios y un puñado de agentes hambrientos de tokens.

La conclusión más honesta es que el gráfico describe el costo de la computación, no el estado del mercado. El debate sobre la burbuja de la IA se resolverá con ingresos, retención y retornos: las medidas que los recuentos de tokens pretenden aproximar pero no pueden reemplazar.

Este artículo se basa en reportes de The Decoder. Lea el artículo original.

Originally published on the-decoder.com