¿Cuántos tokens consume realmente Claude Code? Un experimento comparativo revela: las tres principales plataformas varían hasta 30 veces

marsbitPublicado a 2026-07-31Actualizado a 2026-07-31

Resumen

Un experimento comparativo realizado por Composio evaluó tres frameworks de agentes (Claude Code, Hermes y Kimi Code) ejecutando las mismas 28 tareas con el modelo Kimi K3. Los resultados mostraron una tasa de éxito similar: 22, 21 y 20 tareas exitosas respectivamente. La gran diferencia estuvo en el consumo de tokens: Claude Code usó una mediana de 340,000 tokens, aproximadamente 6 veces más que Kimi Code (61,000 tokens) y 5 veces más que Hermes (67,000 tokens). En algunos casos, la diferencia llegó a ser de hasta 30 veces. En costos, utilizando el precio de Kimi K3 de 3 USD por millón de tokens de entrada, el coste promedio por tarea fue de 0.22 USD para Kimi Code, 0.28 USD para Hermes y 2 USD para Claude Code. En velocidad, Hermes fue el más rápido (179 segundos de mediana), seguido por Kimi Code (297 segundos) y Claude Code (348 segundos). Expertos como Sebastian Raschka señalan que el alto consumo de Claude Code se debe principalmente a tokens de entrada, ya que su framework reintroduce constantemente contexto histórico en cada interacción del agente. Una investigación de Writer respalda la creciente importancia del harness (framework de orquestación), demostrando que optimizarlo puede reducir costos en un 41% y la latencia en un 44%, manteniendo la calidad. La conclusión clave es que, para reducir costos de agentes de IA, optimizar el harness es más impactante que cambiar el modelo, marcando un cambio hacia la era donde "el harness es el producto".

Todos dicen que Claude Code desperdicia tokens, ¿pero cuántos exactamente? Alguien finalmente lo ha calculado.

Recientemente, el equipo de Composio realizó un interesante experimento comparativo. Usaron el mismo modelo Kimi K3 y lo ejecutaron en tres plataformas ("harness") de agentes diferentes —Claude Code, Hermes y Kimi Code—, probando exactamente las mismas 28 tareas.

Los resultados mostraron que la tasa de éxito era similar entre las tres plataformas: Kimi Code completó 22 de 28 tareas, Hermes 21 y Claude Code 20. La diferencia no es grande.

La verdadera brecha la marcó el consumo de tokens. Para la misma tarea, ejecutada en diferentes plataformas, el uso de tokens podía variar hasta 30 veces.

En términos de mediana, Kimi Code usó aproximadamente 61 mil tokens, Hermes alrededor de 67 mil, mientras que Claude Code se disparó a 340 mil, aproximadamente 6 veces más que Kimi Code.

Considerando el precio de Kimi K3 (3 dólares por millón de tokens de entrada, que suelen representar alrededor del 95% del flujo de trabajo de un agente), el costo promedio por tarea sería aproximadamente: Kimi Code 0.22 dólares, Hermes 0.28 dólares y Claude Code hasta 2 dólares. La diferencia es evidente.

La velocidad también varió. En mediana de tiempo, Hermes fue el más rápido con 179 segundos; Kimi Code tardó 297 segundos; Claude Code, 348 segundos.

Por lo tanto, el más rápido fue Hermes, y el que más ahorró tokens fue Kimi Code, y estos dos no coinciden.

El equipo de Composio llegó a una conclusión directa: si quieres reducir el costo de tu agente, primero revisa qué plataforma estás usando, en lugar de apresurarte a cambiar de modelo. Según sus datos, la plataforma por sí sola puede multiplicar el costo por 9, mientras que el rendimiento del modelo es prácticamente similar.

Sebastian Raschka, al ver estos resultados, también publicó un comentario diciendo que esto es similar a lo que observó previamente con Qwen3.6: Claude Code, con una tasa de éxito comparable, a menudo consume entre 2 y 3 veces más tokens que muchas otras plataformas.

Él planteó varias posibles razones: ¿Falta de optimización? ¿Un error? ¿O un diseño intencional (porque podría ayudar en tareas más difíciles)? Dijo que necesitaría investigarlo más a fondo.

Luego agregó una observación de su artículo del mes pasado sobre un agente de codificación local. En ese momento, analizó por qué Claude Code usa más tokens y descubrió que la diferencia está principalmente en los tokens de entrada, no en los de salida. Es decir, Claude no escribe el doble de contenido. Los registros muestran que la plataforma de Claude reintroduce repetidamente más contexto en el modelo durante múltiples interacciones, incluyendo mensajes previos, llamadas a herramientas, salidas de comandos y contenido de archivos. Por ejemplo, en una ejecución, Claude usó alrededor de 578,000 tokens de entrada, pero solo produjo unos 4,500 tokens de salida, abarcando 25 rondas. Por lo tanto, es más probable que la plataforma de Claude acumule o contabilice un historial de "prompts" más grande durante la ejecución de un agente de múltiples pasos.

Estos resultados de prueba parecen revelar una tendencia innegable: La importancia de la plataforma ("harness") ya no es menor que la del modelo en sí.

Un artículo reciente (de Writer, una empresa que desarrolla una plataforma de agentes de IA empresarial) lo demuestra sistemáticamente: mediante experimentos controlados, muestra que cambiar la capa de la plataforma es más efectivo para reducir costos que cambiar el modelo, y todos los modelos se benefician.

Concretamente, llevaron a cabo un estricto experimento de "control de variables": manteniendo fijas 22 tareas empresariales y 6 modelos base (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), solo reemplazaron la capa de orquestación, sustituyendo el ciclo de agente inteligente de nivel de producción tradicional por su propia plataforma, Writer Harness.

Los resultados mostraron: un costo promedio reducido en un 41% por tarea (de 0.21 a 0.12 dólares), una latencia mediana reducida en un 44% (de 48 a 27 segundos), un consumo de tokens reducido en un 38% (de 14.2k a 8.8k), mientras que la calidad de finalización de la tarea se mantuvo básicamente igual (de 0.78 a 0.81, considerada sin diferencia significativa debido al tamaño de muestra). En cuanto a relación costo-beneficio, la calidad obtenida por dólar aumentó en un impresionante 82%, y el número de tareas completadas por millón de tokens pasó de 54.9 a 92.0.

Entonces, ¿después de que los modelos se convirtieron en "servicios básicos", la plataforma es el "aire acondicionado" que determina tu factura de electricidad? En otras palabras: antes se decía "el modelo es el producto", ¿ahora es "la plataforma es el producto"?

Dado que la plataforma es tan importante, ¿no deberíamos comenzar a hacer cuentas más detalladas?

Alguien señaló que es necesario agregar un ítem de "impuesto de plataforma" a los benchmarks existentes. Especialmente considerando que, una vez que las llamadas a herramientas y los reintentos entran en un bucle, este "impuesto" no crece linealmente.

En otras palabras, la competencia futura de agentes, en la primera mitad se tratará de "quién puede hacerlo", y en la segunda mitad será "quién puede hacer lo mismo gastando menos" — y el secreto para ahorrar no está en el modelo, sino en la plataforma.

¿Has tenido una experiencia similar al ejecutar un Agente? Te invitamos a discutirlo en la sección de comentarios.

Este artículo proviene del WeChat Official Account "机器之心" (ID: almosthuman2014), autor: 机器之心.

Preguntas relacionadas

Q¿Cuál fue el hallazgo principal del experimento de Composio sobre el uso de tokens en diferentes frameworks de agentes?

AEl experimento reveló que el consumo de tokens varía enormemente entre los frameworks. Claude Code usó aproximadamente 6 veces más tokens que Kimi Code, llegando a una diferencia máxima de 30 veces en algunas tareas, a pesar de que las tasas de éxito fueron similares.

QSegún el artículo, ¿cuál es el impacto en costos del alto consumo de tokens de Claude Code?

AUtilizando el precio de Kimi K3 de 3 USD por millón de tokens de entrada, el costo promedio por tarea fue de 0.22 USD para Kimi Code, 0.28 USD para Hermes y 2 USD para Claude Code, mostrando una diferencia significativa en costos.

Q¿Qué explicación sugiere Sebastian Raschka para el alto uso de tokens en Claude Code?

ARaschka señala que la diferencia se debe principalmente a los tokens de entrada, no a los de salida. El harness de Claude parece reinyectar constantemente más contexto en el modelo en interacciones de múltiples pasos, como mensajes anteriores, llamadas a herramientas y salidas de comandos.

Q¿Qué tendencia importante destaca el artículo respecto a los frameworks (harness) y los modelos de IA?

AEl artículo destaca que la importancia del harness ya es comparable a la del modelo en sí. Un buen harness puede reducir costos y latencia de forma más efectiva que cambiar el modelo, como demostró el experimento de Writer, que redujo costos un 41% y la latencia un 44% solo cambiando la capa de orquestación.

Q¿Qué término se propone en el artículo para medir el impacto económico de los diferentes harness en los benchmarks de agentes?

ASe propone incluir un 'impuesto del harness' (harness tax) en los benchmarks existentes. Este concepto reconoce que el costo adicional del harness, especialmente cuando hay bucles de llamadas a herramientas y reintentos, no crece de manera lineal y puede ser un factor económico crucial.

Lecturas Relacionadas

Zcash, Bitcoin Cash y Cardano muestran ganancias, con ZEC liderando el alza del 47%

En las últimas 24 horas, varias altcoins han registrado fuertes ganancias, lideradas por Zcash (ZEC) con un impresionante aumento del 47.1% hasta los 836 dólares, antes de estabilizarse alrededor de 810 dólares. Bitcoin Cash (BCH) también subió un 31.4%, mientras que Cardano (ADA) avanzó un 19%. El crecimiento de Zcash se atribuye al interés por activos de privacidad y al esfuerzo de Grayscale por convertir su fondo de inversión en un ETF spot en EE.UU., lo que lo convertiría en el primer ETF de una criptomoneda centrada en la privacidad. El repunte se extendió a otras monedas como Dogecoin (DOGE), Stellar (XLM), Chainlink (LINK) e Hyperliquid (HYPE), lo que sugiere una inyección general de liquidez más que un catalizador específico. Este impulso alcista está respaldado por el renovado entusiasmo del presidente Trump hacia la futura regulación de activos digitales y por medidas del Tesoro de EE.UU. que reducen los rendimientos de los bonos, liberando capital para activos de riesgo. Analistas advierten que estos rápidos repuntes suelen estar acompañados de un alto apalancamiento, lo que podría amplificar futuras correcciones. El volumen de operaciones aumentó significativamente, confirmando la fuerza detrás del movimiento. La atención se centra ahora en el progreso legislativo en las próximas semanas para determinar si el rally puede sostenerse.

cryptonews.ruHace 30 min(s)

Zcash, Bitcoin Cash y Cardano muestran ganancias, con ZEC liderando el alza del 47%

cryptonews.ruHace 30 min(s)

Debido a cambios de estrategia, se esperan modificaciones en los sistemas de recompensas y comisiones en los exchanges de criptomonedas

Debido a la continuación del mercado bajista en el segundo trimestre, los ingresos por operaciones cayeron en las principales bolsas de criptomonedas (Coinbase, Bullish, Gemini). En respuesta, las plataformas están ajustando sus estrategias, centrándose más en productos alternativos como las monedas estables y los mercados de predicción para reducir su dependencia de la volatilidad del mercado. Coinbase, por ejemplo, está recortando costes pero aumentando las recompensas por mantener su moneda estable USDC, con la que capta cerca de la mitad de su volumen total. Gemini está potenciando sus mercados de predicción, ofreciendo incentivos a usuarios y creadores de mercado, aunque el crecimiento de ingresos en este segmento sigue siendo modesto. Bullish, orientada a inversores institucionales, lanzó un programa de recompensas que le permitió aumentar sus ingresos por transacciones interanuales, a diferencia de sus competidores. Aunque los volúmenes de operación bajaron, algunas bolsas reportan una mejora en la "economía de comisiones", indicando que pueden estar obteniendo más ingresos por operación a pesar del menor volumen. Si se consolida un mercado alcista, podría recuperarse el negocio tradicional de operaciones. Sin embargo, la creciente competencia y la posible convergencia con las finanzas tradicionales podrían llevar a las plataformas a ofrecer más incentivos y recompensas en sus nuevos productos, en un entorno donde los límites entre sectores se desdibujan.

cryptonews.ruHace 31 min(s)

Debido a cambios de estrategia, se esperan modificaciones en los sistemas de recompensas y comisiones en los exchanges de criptomonedas

cryptonews.ruHace 31 min(s)

Trading

Spot
活动图片