La IA ha empezado a usar IA por los humanos, y su consumo de tokens ya es 5.2 veces mayor que el humano

marsbitPublicado a 2026-08-25Actualizado a 2026-08-25

Resumen

El 6 de febrero de 2026 marcó un hito: por última vez, el uso humano de tokens en modelos de IA superó al de los agentes inteligentes. Según datos de OpenRouter, en solo medio año, el consumo de tokens por parte de agentes se multiplicó por 14, alcanzando 7,3 billones, mientras que el uso humano creció 2,8 veces hasta 1,4 billones. Actualmente, los agentes consumen 5,2 veces más tokens que las personas. La clave de esta diferencia radica en el comportamiento: los humanos interactúan en diálogos breves, mientras que los agentes ejecutan tareas autónomas de larga duración, realizando múltiples llamadas a herramientas y procesamiento incremental. Aunque aproximadamente el 70% de los tokens de los agentes provienen de caché (más barato), el volumen total dispara los costes. Por ejemplo, Uber agotó en cuatro meses su presupuesto anual para Claude Code. La brecha no está en el modelo utilizado, sino en su integración en flujos de trabajo reales. Las empresas más avanzadas muestran un uso de tokens 8,3 veces mayor por usuario, gracias a una mayor adopción de plugins y habilidades específicas. Sin embargo, el crecimiento explosivo plantea un desafío crítico: la supervisión. Muchas tareas iniciadas por agentes aún requieren aprobación humana, pero la capacidad de verificación no escala al mismo ritmo. El verdadero reto futuro no será si se usa IA, sino quién valida y decide sobre los resultados generados automáticamente.

6 de febrero de 2026. La última vez que los humanos superaron a la IA.

Ese día, el uso de tokens por parte de los humanos en OpenRouter fue superado por primera vez por los agentes inteligentes.

En solo seis meses, la diferencia entre las dos líneas se ha ampliado a cinco veces.

Según estadísticas de OpenRouter, hasta el 10 de agosto, el uso de tokens de tipo Agente aumentó de aproximadamente 0,51 billones a 7,3 billones, un crecimiento de 14 veces; mientras que la línea humana también creció a 1,4 billones, pero solo 2,8 veces.

Una brecha tan grande hace que incluso Peter se sienta desorientado: parece como si hubieran pasado 10 años, pero el 6 de febrero fue solo hace medio año.

No importa quién seas, sino cómo lo uses

Primero, aclaremos de dónde vienen estos datos y cómo se calculan.

OpenRouter es una de las mayores puertas de enlace de modelos del mundo, conectando a unos 70 proveedores de modelos con desarrolladores, procesando 28 billones de tokens a la semana.

Según estimaciones de Chris Clark, cofundador y COO de OpenRouter, esto representa aproximadamente el 1% del volumen global de inferencia, de los cuales la mitad proviene de Estados Unidos.

¿Y cómo se distingue entre tokens usados por humanos y por Agentes dentro de ese 1%?

OpenRouter no mira quién eres, sino cómo usas el servicio. El método específico es rastrear el comportamiento mediante la clave API:

Con qué frecuencia se llaman las herramientas, cuántos segundos pasan entre dos respuestas, cuántos intercambios hay en una conversación... Hay un total de 7 señales de este tipo, se ponderan para dar una puntuación y luego se clasifica el tráfico en tres niveles: Agente, Mixto y Humano.

¿Por qué se puede distinguir con solo observar el comportamiento?

La razón es simple: los humanos usan la IA haciendo una pregunta, tomando un descanso, luego leyendo, pensando y escribiendo; los Agentes, en cambio, funcionan sin parar, llamando herramientas de forma continua, ejecutando ciclos de conversación, un ritmo que claramente no es propio de un ser orgánico.

Por lo tanto, es un modelo de estimación, pero la dirección no es errónea.

Un objetivo humano hoy en día puede desencadenar docenas de llamadas a modelos y herramientas. Las estadísticas de tokens no miden cuántas personas usan la IA, sino cuán profundo es el trabajo que la IA hace por los humanos.

Una tarea de Agente equivale a cien conversaciones

Lo que realmente marca la diferencia entre humanos y Agentes es la forma en que cada uno los usa.

¿Cómo es una solicitud humana?

Abrir el cuadro de diálogo, escribir un prompt, esperar una respuesta, copiarla, cerrar.

De principio a fin, tú y el modelo intercambian menos de diez frases, contabilizando a lo sumo unos miles de tokens.

Pero la solicitud de un Agente inteligente es completamente diferente.

Le das un objetivo y él continúa por su cuenta: leer archivos, llamar herramientas, escribir resultados, volver a leer, modificar, dando vueltas hasta completar la tarea.

Los humanos empaquetan el objetivo, las normas y el contexto en ese prompt inicial, y luego el modelo realiza lecturas y escrituras incrementales sobre ese mismo contexto.

¡Mientras tú todavía estás en el modo pregunta-respuesta, el Agente ya puede ejecutar todo un día con una sola instrucción!

Así que la misma persona, que por la mañana copiaba y pegaba manualmente en el cuadro de diálogo, por la tarde activa un Agente para que ejecute, y el registro de tokens inmediatamente cambia de orden de magnitud.

Las palabras de Peter dan en el clavo: El verdadero cambio de comportamiento que desbloquea estos volúmenes es que la gente ha comenzado a dejar que los Agentes funcionen de forma autónoma durante largos periodos.

Por baratos que sean los tokens, pueden quemar el presupuesto

Al ver "14 veces", tu primera reacción podría ser pensar en el dinero que se quema.

Es cierto que se quema dinero, pero no de la forma que imaginas.

Peter añade un dato: como los Agentes son inherentemente multironda, en una solicitud de Agente promedio, casi el 70% de los tokens provienen de prompts cacheados, y el costo de los tokens cacheados suele ser mucho más bajo.

La lógica no es difícil de entender.

El Agente realiza lecturas y escrituras repetidas en torno a un mismo objetivo: la primera vez introduce todo ese contexto (normas de código, manuales de operación, listas de herramientas) y se paga el precio completo; en cada ronda posterior solo se realizan actualizaciones incrementales, y las partes que están en caché se cobran solo a una fracción del precio normal de entrada.

En otras palabras, en esa curva empinada, casi el 70% corresponde al mismo contexto que se reutiliza una y otra vez.

Comparación de la composición de tokens entre Agentes y Humanos, los tokens cacheados contribuyen con casi todo el incremento. a16z lo escribe como más del 85% en términos de volumen total; en el post original de Peter, el promedio por solicitud es de casi el 70%.

Así que el precio unitario ciertamente baja, pero no puede con el consumo desbocado.

Praveen Neppalli Naga, CTO de Uber, reveló a principios de este año que sus ingenieros agotaron el presupuesto anual de Claude Code en solo cuatro meses.

Según los medios, él mismo gastó 1.200 dólares en una demostración de dos horas.

Precio unitario con un 70% de descuento, consumo multiplicado por 14. El resultado de esta multiplicación no es difícil de calcular.

EY hizo un cálculo aún más claro: la misma interacción de servicio al cliente costaba alrededor de 0,04 dólares en 2023, y para 2026 aumentó a aproximadamente 1,20 dólares, 30 veces más.

No es que los modelos se hayan vuelto más caros.

Antes era: el cliente pregunta, el sistema responde, una línea recta hasta el final.

Ahora el cliente sigue haciendo la misma pregunta, pero detrás hay consultas de tickets, verificación de inventario, revisión de registros, pensando una ronda, modificando otra, dando una docena de vueltas antes de emitir una respuesta.

La misma cosa, hecha de manera diferente, cambia el precio.

Goldman Sachs estima que la IA Agente podría aumentar el consumo de tokens para 2030 en 24 veces.

Cualquier costo que aumente 14 veces en medio año hará que la gente empiece a escrutar los detalles. Peter dice que esta es precisamente la razón por la que los modelos de pesos abiertos y los servicios de tokens de bajo costo han llamado repentinamente la atención.

Y además, aunque los tokens cacheados sean baratos, consumen memoria.

Un Agente que funciona durante horas, sin necesidad de reiniciar desde el principio, depende de que la memoria sostenga todo ese contexto.

Aquí se puede encontrar la mitad de la respuesta a por qué la memoria de alto ancho de banda (HBM) ha estado tan escasa recientemente.

La línea divisoria no está en qué modelo uses

Entonces, ¿el método para ahorrar dinero es cambiar a un modelo más barato?

La verdadera línea divisoria no está en qué modelo uses.

El mismo modelo, si lo usas como un cuadro de búsqueda, genera miles de tokens al día; si lo conectas a tus propios archivos, herramientas y un flujo de trabajo continuo, no es raro que genere decenas de millones de tokens al día.

La diferencia no está en el modelo, sino en si lo has integrado en un trabajo real.

¿Cuán grande es esta brecha? Un conjunto de datos de OpenAI puede servir como referencia:

Las empresas que usan la IA más profundamente (el 10% superior), generan 8,3 veces más tokens por usuario activo que las empresas típicas. En enero, esta brecha era solo de 2,6 veces.

En medio año, la brecha se amplió más de tres veces.

Lo que marca la diferencia no es el modelo, son los complementos.

En el mismo conjunto de estadísticas, el 21% de los usuarios activos de las empresas líderes usan complementos semanalmente, frente a solo el 9% en las empresas típicas; la tasa de adopción de habilidades es del 19% frente al 3%. Dentro de OpenAI, esta cifra es del 95%.

Empaquetar las tareas que haces habitualmente en un conjunto de habilidades reutilizables evita que el Agente tenga que empezar desde cero cada vez.

Cada búsqueda menos, cada repetición evitada, ahorra dinero.

Se gastan los tokens, ¿quién los aprueba?

Sin embargo, por muy bien que se calcule la cuenta, eso no significa que el trabajo se haga con confianza.

El aumento explosivo del tráfico de Agentes no significa que la IA actúe de forma totalmente autónoma. Muchas tareas siguen siendo iniciadas por humanos, y a menudo incluyen aprobaciones manuales intermedias.

Un desarrollador que atiende a clientes del sector servicios mencionó en los comentarios del post original de Peter que los dueños a los que sirve nunca han pensado en dejar todo en manos de la IA; compras, envíos, firmas, cada paso debe volver a una persona.

Pero el problema es que al volver, no siempre se encuentra realmente a alguien.

Otro profesional comentó que su Agente eliminó 18 videos de una cuenta publicitaria, y pasó un día entero antes de que alguien se diera cuenta.

No es que el modelo haya cometido un error muy grave, es que simplemente nadie revisó ese paso.

El gasto en tokens puede multiplicarse por 14 en medio año, pero el personal de supervisión no puede multiplicarse a ese ritmo. Esta es quizás la cuenta más fácil de pasar por alto y, a la vez, más costosa en esta ronda de crecimiento.

Análisis, investigación, borradores iniciales, propuestas, acciones de ejecución repetitivas... todo esto será abundante en el futuro.

Lo que realmente será escaso es la verificación, el juicio y la decisión sobre qué vale la pena hacer.

La IA ya se ha convertido en el principal consumidor de tokens, pero hasta el día de hoy, no puede firmar por ti.

En el futuro, la verdadera pregunta ya no será si usas la IA o no.

Sino quién aprueba el trabajo que la IA hace por ti, y quién decide el siguiente paso.

Referencias:

https://www.linkedin.com/posts/peterjameswalker_february-6th-2026-potentially-the-last-share-7493029881841344512-IK89/

https://the-decoder.com/ai-is-becoming-ais-biggest-customer-as-agentic-token-usage-jumps-14x-on-openrouter/

https://openai.com/signals/enterprise-data/

https://www.a16z.news/p/charts-of-the-week-winds-of-thematic

https://www.ey.com/en_us/insights/ai/agentic-ai-token-costs

Este artículo proviene del WeChat público "新智元" (Nueva Era de la Inteligencia), autor: ASI Apocalipsis; editor: Yuanyu

Preguntas relacionadas

Q¿Qué fecha se menciona como el último día en que la humanidad superó al IA en el uso de tokens según OpenRouter?

ASegún el artículo, la fecha mencionada es el 6 de febrero de 2026, el día en que el uso de tokens por humanos fue igualado por los agentes de IA por primera vez en OpenRouter.

Q¿Según las estadísticas de OpenRouter, cuántas veces ha aumentado el uso de tokens de los Agentes en comparación con el de los humanos hasta el 10 de agosto?

AHasta el 10 de agosto, el uso de tokens de los Agentes aumentó aproximadamente 14 veces (de 0,51 billones a 7,3 billones), mientras que el uso de tokens por humanos aumentó 2,8 veces (hasta 1,4 billones). En términos de volumen, los Agentes usan aproximadamente 5,2 veces más tokens que los humanos.

Q¿Cómo distingue OpenRouter entre el tráfico generado por humanos y el generado por Agentes de IA?

AOpenRouter no identifica al usuario directamente, sino que analiza el comportamiento a través de la clave API. Evalúa señales como la frecuencia de uso de herramientas, el tiempo entre respuestas y el número de intercambios en una conversación, entre un total de 7 indicadores, para clasificar el tráfico en tres categorías: Agente, Mixto o Humano.

Q¿Qué explica la gran diferencia en el volumen de tokens utilizados entre las solicitudes humanas y las de los Agentes?

ALa gran diferencia se debe a la naturaleza de las tareas. Mientras que una solicitud humana típica implica unos pocos intercambios de preguntas y respuestas, un Agente, una vez recibido un objetivo, puede operar de forma autónoma durante horas o días, realizando múltiples ciclos de lectura, uso de herramientas y escritura, lo que consume una cantidad de tokens mucho mayor.

QSegún el artículo, ¿cuál es uno de los problemas clave asociados al rápido aumento del uso de tokens por parte de los Agentes de IA?

AUno de los problemas clave es la validación o aprobación humana. Aunque el uso de tokens por parte de los Agentes ha aumentado drásticamente, muchos procesos aún requieren supervisión o aprobación humana en algún punto. La falta de recursos humanos para revisar todas las acciones de los Agentes puede llevar a errores costosos o acciones no detectadas, como la eliminación no supervisada de contenido.

Lecturas Relacionadas

Fin de la criptografía antigua: cómo Ethereum se prepara para la era de la computación cuántica

Los desarrolladores de Ethereum han propuesto un nuevo método para gestionar depósitos en el sistema de staking, con el objetivo principal de preparar la red ante la futura amenaza de los ordenadores cuánticos. Este borrador, publicado en agosto de 2026, busca actualizar la infraestructura para admitir criptografía post-cuántica. Actualmente, la seguridad de Ethereum y otras criptomonedas se basa en la criptografía de curva elíptica, que los ordenadores cuánticos podrían llegar a vulnerar al calcular claves privadas a partir de las públicas. Aunque las estimaciones sobre el momento de esta amenaza varían (desde menos de una década hasta ser un riesgo más a largo plazo), proyectos como Ethereum, Solana y XRP Ledger ya están trabajando en defensas. La propuesta de Ethereum introduce un contrato de depósito más flexible, capaz de aceptar claves de distintos tipos y longitudes (hasta 8.192 bytes) identificadas con una etiqueta. "0" se reserva para el formato actual, dejando otras libres para futuros algoritmos post-cuánticos. El cambio también modifica técnicamente cómo se transmiten los datos de los depósitos entre las capas de la red, sin afectar la experiencia del usuario. Además, se establece un proceso de transición en tres fases controladas, evitando un cambio brusco y permitiendo una migración ordenada cuando se decida adoptar un nuevo estándar criptográfico. En resumen, esta propuesta constituye un paso proactivo para modernizar la infraestructura central de Ethereum, aunque no resuelve directamente la vulnerabilidad de las claves públicas ya expuestas en la cadena de bloques. Su implementación formal y cronología aún están por determinarse.

cryptonews.ruHace 8 min(s)

Fin de la criptografía antigua: cómo Ethereum se prepara para la era de la computación cuántica

cryptonews.ruHace 8 min(s)

El ecosistema de HyperEVM se calienta: ¿Los memes encienden la chispa, será el próximo Robinhood?

Autor: Biteye En los últimos días, HyperEVM ha pasado rápidamente de ser la infraestructura de cadena específica de Hype a un "campo de trading de alta volatilidad". Tras el récord histórico de HYPE y la rápida rotación de memes, el gas en HyperEVM se disparó, alcanzando más de diez dólares por transacción, superando incluso a la red principal de ETH. El impulso inicial provino del fuerte desempeño de HYPE tras los comentarios de Trump. HYPE cotiza alrededor de $79.65, con subidas del 35.4% en 7 días y del 38.7% en 30 días, alcanzando un máximo histórico de $83.27. **Resumen de proyectos destacados en HyperEVM:** * **Memes: EGG y CHAMELEON** lideraron la euforia. EGG, el meme nativo inspirado en un tuit de Jeff Yan, experimentó ganancias del 14,000% en 24h. CHAMELEON, vinculado a la historia empresarial de Jeff, alcanzó una capitalización de ~$4M. * **Launchpad: Motion** funciona como una versión HyperEVM de Pump.fun, facilitando el lanzamiento de tokens y beneficiándose si continúa la temporada de memes. * **Staking: Kinetiq (KNTQ)** es el principal protocolo de staking líquido. Su token, KNTQ, captura valor a través de recompra y redistribución de ingresos. * **HIP-3: Kinetiq Launch** es una plataforma de lanzamiento para intercambios de perpetuos HIP-3, añadiendo una nueva narrativa para KNTQ. * **Préstamos: HyperLend (HPL)** es el principal mercado de préstamos, con un TVL de ~$570M. Es valorado por su "baja capitalización y alto TVL". * **DEX: Project X** es el AMM de liquidez concentrada líder, capturando ~50-60% del volumen comercial en HyperEVM. **Conclusión:** El actual fervor en HyperEVM parece ser una reevaluación impulsada por el récord de HYPE. Para que se consolide, es crucial observar la retención de usuarios atraídos por los memes y la capacidad de los proyectos utilitarios para generar usuarios y ingresos reales. Un desafío importante son las altas tarifas de gas (hasta $10-20 por transacción), que, aunque aumentan la demanda de HYPE, podrían limitar el crecimiento del trading de memes y la prosperidad del ecosistema a largo plazo.

marsbitHace 20 min(s)

El ecosistema de HyperEVM se calienta: ¿Los memes encienden la chispa, será el próximo Robinhood?

marsbitHace 20 min(s)

¡El intercambio de Bitcoin Coinbase anuncia la adición de dos altcoins en su plataforma de trading al contado! Aquí los detalles

La bolsa de criptomonedas Coinbase anunció que añadirá dos nuevos activos desarrollados en la red Base a su mercado de trading spot. Según un comunicado del 25 de agosto, el trading de Basecat (BASECAT) y DebtReliefBot (DRB) estará disponible en las regiones admitidas una vez se cumplan las condiciones de liquidez necesarias. La plataforma creará pares de trading en dólares estadounidenses (BASECAT-USD y DRB-USD) para estos activos. La red Base, una capa 2 de Ethereum desarrollada por Coinbase, alberga diversos proyectos cripto con el objetivo de ofrecer bajos costes de transacción y alta capacidad. Los inversores minoristas podrán acceder a los nuevos pares a través del sitio web, la app móvil y la plataforma avanzada de Coinbase, mientras que los clientes institucionales lo harán a través de Coinbase Exchange. Este listado amplía el acceso de los inversores a nuevos proyectos y proporciona a los activos una base de usuarios más amplia, mejorando su liquidez y volumen de negociación. Coinbase aclaró que el soporte para el trading podría no estar disponible automáticamente en todas las regiones y que el lanzamiento se realizará de forma gradual tras cumplir los requisitos de liquidez, sin especificar una fecha concreta. La incorporación es notable por aumentar la visibilidad de los tokens del ecosistema Base en las principales bolsas centralizadas. Coinbase recuerda a los inversores la importancia de informarse sobre los proyectos, su liquidez y los riesgos asociados antes de operar.

cryptonews.ruHace 23 min(s)

¡El intercambio de Bitcoin Coinbase anuncia la adición de dos altcoins en su plataforma de trading al contado! Aquí los detalles

cryptonews.ruHace 23 min(s)

Trading

Spot
活动图片