6 de febrero de 2026. La última vez que los humanos superaron a la IA.
Ese día, el uso de tokens por parte de los humanos en OpenRouter fue superado por primera vez por los agentes inteligentes.

En solo seis meses, la diferencia entre las dos líneas se ha ampliado a cinco veces.
Según estadísticas de OpenRouter, hasta el 10 de agosto, el uso de tokens de tipo Agente aumentó de aproximadamente 0,51 billones a 7,3 billones, un crecimiento de 14 veces; mientras que la línea humana también creció a 1,4 billones, pero solo 2,8 veces.

Una brecha tan grande hace que incluso Peter se sienta desorientado: parece como si hubieran pasado 10 años, pero el 6 de febrero fue solo hace medio año.
No importa quién seas, sino cómo lo uses
Primero, aclaremos de dónde vienen estos datos y cómo se calculan.
OpenRouter es una de las mayores puertas de enlace de modelos del mundo, conectando a unos 70 proveedores de modelos con desarrolladores, procesando 28 billones de tokens a la semana.
Según estimaciones de Chris Clark, cofundador y COO de OpenRouter, esto representa aproximadamente el 1% del volumen global de inferencia, de los cuales la mitad proviene de Estados Unidos.
¿Y cómo se distingue entre tokens usados por humanos y por Agentes dentro de ese 1%?
OpenRouter no mira quién eres, sino cómo usas el servicio. El método específico es rastrear el comportamiento mediante la clave API:
Con qué frecuencia se llaman las herramientas, cuántos segundos pasan entre dos respuestas, cuántos intercambios hay en una conversación... Hay un total de 7 señales de este tipo, se ponderan para dar una puntuación y luego se clasifica el tráfico en tres niveles: Agente, Mixto y Humano.
¿Por qué se puede distinguir con solo observar el comportamiento?
La razón es simple: los humanos usan la IA haciendo una pregunta, tomando un descanso, luego leyendo, pensando y escribiendo; los Agentes, en cambio, funcionan sin parar, llamando herramientas de forma continua, ejecutando ciclos de conversación, un ritmo que claramente no es propio de un ser orgánico.
Por lo tanto, es un modelo de estimación, pero la dirección no es errónea.
Un objetivo humano hoy en día puede desencadenar docenas de llamadas a modelos y herramientas. Las estadísticas de tokens no miden cuántas personas usan la IA, sino cuán profundo es el trabajo que la IA hace por los humanos.
Una tarea de Agente equivale a cien conversaciones
Lo que realmente marca la diferencia entre humanos y Agentes es la forma en que cada uno los usa.
¿Cómo es una solicitud humana?
Abrir el cuadro de diálogo, escribir un prompt, esperar una respuesta, copiarla, cerrar.
De principio a fin, tú y el modelo intercambian menos de diez frases, contabilizando a lo sumo unos miles de tokens.
Pero la solicitud de un Agente inteligente es completamente diferente.
Le das un objetivo y él continúa por su cuenta: leer archivos, llamar herramientas, escribir resultados, volver a leer, modificar, dando vueltas hasta completar la tarea.
Los humanos empaquetan el objetivo, las normas y el contexto en ese prompt inicial, y luego el modelo realiza lecturas y escrituras incrementales sobre ese mismo contexto.
¡Mientras tú todavía estás en el modo pregunta-respuesta, el Agente ya puede ejecutar todo un día con una sola instrucción!
Así que la misma persona, que por la mañana copiaba y pegaba manualmente en el cuadro de diálogo, por la tarde activa un Agente para que ejecute, y el registro de tokens inmediatamente cambia de orden de magnitud.
Las palabras de Peter dan en el clavo: El verdadero cambio de comportamiento que desbloquea estos volúmenes es que la gente ha comenzado a dejar que los Agentes funcionen de forma autónoma durante largos periodos.
Por baratos que sean los tokens, pueden quemar el presupuesto
Al ver "14 veces", tu primera reacción podría ser pensar en el dinero que se quema.
Es cierto que se quema dinero, pero no de la forma que imaginas.
Peter añade un dato: como los Agentes son inherentemente multironda, en una solicitud de Agente promedio, casi el 70% de los tokens provienen de prompts cacheados, y el costo de los tokens cacheados suele ser mucho más bajo.
La lógica no es difícil de entender.
El Agente realiza lecturas y escrituras repetidas en torno a un mismo objetivo: la primera vez introduce todo ese contexto (normas de código, manuales de operación, listas de herramientas) y se paga el precio completo; en cada ronda posterior solo se realizan actualizaciones incrementales, y las partes que están en caché se cobran solo a una fracción del precio normal de entrada.
En otras palabras, en esa curva empinada, casi el 70% corresponde al mismo contexto que se reutiliza una y otra vez.

Comparación de la composición de tokens entre Agentes y Humanos, los tokens cacheados contribuyen con casi todo el incremento. a16z lo escribe como más del 85% en términos de volumen total; en el post original de Peter, el promedio por solicitud es de casi el 70%.
Así que el precio unitario ciertamente baja, pero no puede con el consumo desbocado.
Praveen Neppalli Naga, CTO de Uber, reveló a principios de este año que sus ingenieros agotaron el presupuesto anual de Claude Code en solo cuatro meses.
Según los medios, él mismo gastó 1.200 dólares en una demostración de dos horas.
Precio unitario con un 70% de descuento, consumo multiplicado por 14. El resultado de esta multiplicación no es difícil de calcular.
EY hizo un cálculo aún más claro: la misma interacción de servicio al cliente costaba alrededor de 0,04 dólares en 2023, y para 2026 aumentó a aproximadamente 1,20 dólares, 30 veces más.
No es que los modelos se hayan vuelto más caros.
Antes era: el cliente pregunta, el sistema responde, una línea recta hasta el final.
Ahora el cliente sigue haciendo la misma pregunta, pero detrás hay consultas de tickets, verificación de inventario, revisión de registros, pensando una ronda, modificando otra, dando una docena de vueltas antes de emitir una respuesta.
La misma cosa, hecha de manera diferente, cambia el precio.
Goldman Sachs estima que la IA Agente podría aumentar el consumo de tokens para 2030 en 24 veces.
Cualquier costo que aumente 14 veces en medio año hará que la gente empiece a escrutar los detalles. Peter dice que esta es precisamente la razón por la que los modelos de pesos abiertos y los servicios de tokens de bajo costo han llamado repentinamente la atención.
Y además, aunque los tokens cacheados sean baratos, consumen memoria.
Un Agente que funciona durante horas, sin necesidad de reiniciar desde el principio, depende de que la memoria sostenga todo ese contexto.
Aquí se puede encontrar la mitad de la respuesta a por qué la memoria de alto ancho de banda (HBM) ha estado tan escasa recientemente.
La línea divisoria no está en qué modelo uses
Entonces, ¿el método para ahorrar dinero es cambiar a un modelo más barato?
La verdadera línea divisoria no está en qué modelo uses.
El mismo modelo, si lo usas como un cuadro de búsqueda, genera miles de tokens al día; si lo conectas a tus propios archivos, herramientas y un flujo de trabajo continuo, no es raro que genere decenas de millones de tokens al día.
La diferencia no está en el modelo, sino en si lo has integrado en un trabajo real.
¿Cuán grande es esta brecha? Un conjunto de datos de OpenAI puede servir como referencia:
Las empresas que usan la IA más profundamente (el 10% superior), generan 8,3 veces más tokens por usuario activo que las empresas típicas. En enero, esta brecha era solo de 2,6 veces.

En medio año, la brecha se amplió más de tres veces.
Lo que marca la diferencia no es el modelo, son los complementos.
En el mismo conjunto de estadísticas, el 21% de los usuarios activos de las empresas líderes usan complementos semanalmente, frente a solo el 9% en las empresas típicas; la tasa de adopción de habilidades es del 19% frente al 3%. Dentro de OpenAI, esta cifra es del 95%.
Empaquetar las tareas que haces habitualmente en un conjunto de habilidades reutilizables evita que el Agente tenga que empezar desde cero cada vez.
Cada búsqueda menos, cada repetición evitada, ahorra dinero.
Se gastan los tokens, ¿quién los aprueba?
Sin embargo, por muy bien que se calcule la cuenta, eso no significa que el trabajo se haga con confianza.
El aumento explosivo del tráfico de Agentes no significa que la IA actúe de forma totalmente autónoma. Muchas tareas siguen siendo iniciadas por humanos, y a menudo incluyen aprobaciones manuales intermedias.
Un desarrollador que atiende a clientes del sector servicios mencionó en los comentarios del post original de Peter que los dueños a los que sirve nunca han pensado en dejar todo en manos de la IA; compras, envíos, firmas, cada paso debe volver a una persona.
Pero el problema es que al volver, no siempre se encuentra realmente a alguien.
Otro profesional comentó que su Agente eliminó 18 videos de una cuenta publicitaria, y pasó un día entero antes de que alguien se diera cuenta.

No es que el modelo haya cometido un error muy grave, es que simplemente nadie revisó ese paso.
El gasto en tokens puede multiplicarse por 14 en medio año, pero el personal de supervisión no puede multiplicarse a ese ritmo. Esta es quizás la cuenta más fácil de pasar por alto y, a la vez, más costosa en esta ronda de crecimiento.
Análisis, investigación, borradores iniciales, propuestas, acciones de ejecución repetitivas... todo esto será abundante en el futuro.
Lo que realmente será escaso es la verificación, el juicio y la decisión sobre qué vale la pena hacer.
La IA ya se ha convertido en el principal consumidor de tokens, pero hasta el día de hoy, no puede firmar por ti.
En el futuro, la verdadera pregunta ya no será si usas la IA o no.
Sino quién aprueba el trabajo que la IA hace por ti, y quién decide el siguiente paso.
Referencias:
https://www.linkedin.com/posts/peterjameswalker_february-6th-2026-potentially-the-last-share-7493029881841344512-IK89/
https://the-decoder.com/ai-is-becoming-ais-biggest-customer-as-agentic-token-usage-jumps-14x-on-openrouter/
https://openai.com/signals/enterprise-data/
https://www.a16z.news/p/charts-of-the-week-winds-of-thematic
https://www.ey.com/en_us/insights/ai/agentic-ai-token-costs
Este artículo proviene del WeChat público "新智元" (Nueva Era de la Inteligencia), autor: ASI Apocalipsis; editor: Yuanyu





