¿Cuántos tokens consume realmente Claude Code? Un experimento comparativo revela: las tres principales plataformas varían hasta 30 veces

marsbitPublicado a 2026-07-31Actualizado a 2026-07-31

Resumen

Un experimento comparativo realizado por Composio evaluó tres frameworks de agentes (Claude Code, Hermes y Kimi Code) ejecutando las mismas 28 tareas con el modelo Kimi K3. Los resultados mostraron una tasa de éxito similar: 22, 21 y 20 tareas exitosas respectivamente. La gran diferencia estuvo en el consumo de tokens: Claude Code usó una mediana de 340,000 tokens, aproximadamente 6 veces más que Kimi Code (61,000 tokens) y 5 veces más que Hermes (67,000 tokens). En algunos casos, la diferencia llegó a ser de hasta 30 veces. En costos, utilizando el precio de Kimi K3 de 3 USD por millón de tokens de entrada, el coste promedio por tarea fue de 0.22 USD para Kimi Code, 0.28 USD para Hermes y 2 USD para Claude Code. En velocidad, Hermes fue el más rápido (179 segundos de mediana), seguido por Kimi Code (297 segundos) y Claude Code (348 segundos). Expertos como Sebastian Raschka señalan que el alto consumo de Claude Code se debe principalmente a tokens de entrada, ya que su framework reintroduce constantemente contexto histórico en cada interacción del agente. Una investigación de Writer respalda la creciente importancia del harness (framework de orquestación), demostrando que optimizarlo puede reducir costos en un 41% y la latencia en un 44%, manteniendo la calidad. La conclusión clave es que, para reducir costos de agentes de IA, optimizar el harness es más impactante que cambiar el modelo, marcando un cambio hacia la era donde "el harness es el producto".

Todos dicen que Claude Code desperdicia tokens, ¿pero cuántos exactamente? Alguien finalmente lo ha calculado.

Recientemente, el equipo de Composio realizó un interesante experimento comparativo. Usaron el mismo modelo Kimi K3 y lo ejecutaron en tres plataformas ("harness") de agentes diferentes —Claude Code, Hermes y Kimi Code—, probando exactamente las mismas 28 tareas.

Los resultados mostraron que la tasa de éxito era similar entre las tres plataformas: Kimi Code completó 22 de 28 tareas, Hermes 21 y Claude Code 20. La diferencia no es grande.

La verdadera brecha la marcó el consumo de tokens. Para la misma tarea, ejecutada en diferentes plataformas, el uso de tokens podía variar hasta 30 veces.

En términos de mediana, Kimi Code usó aproximadamente 61 mil tokens, Hermes alrededor de 67 mil, mientras que Claude Code se disparó a 340 mil, aproximadamente 6 veces más que Kimi Code.

Considerando el precio de Kimi K3 (3 dólares por millón de tokens de entrada, que suelen representar alrededor del 95% del flujo de trabajo de un agente), el costo promedio por tarea sería aproximadamente: Kimi Code 0.22 dólares, Hermes 0.28 dólares y Claude Code hasta 2 dólares. La diferencia es evidente.

La velocidad también varió. En mediana de tiempo, Hermes fue el más rápido con 179 segundos; Kimi Code tardó 297 segundos; Claude Code, 348 segundos.

Por lo tanto, el más rápido fue Hermes, y el que más ahorró tokens fue Kimi Code, y estos dos no coinciden.

El equipo de Composio llegó a una conclusión directa: si quieres reducir el costo de tu agente, primero revisa qué plataforma estás usando, en lugar de apresurarte a cambiar de modelo. Según sus datos, la plataforma por sí sola puede multiplicar el costo por 9, mientras que el rendimiento del modelo es prácticamente similar.

Sebastian Raschka, al ver estos resultados, también publicó un comentario diciendo que esto es similar a lo que observó previamente con Qwen3.6: Claude Code, con una tasa de éxito comparable, a menudo consume entre 2 y 3 veces más tokens que muchas otras plataformas.

Él planteó varias posibles razones: ¿Falta de optimización? ¿Un error? ¿O un diseño intencional (porque podría ayudar en tareas más difíciles)? Dijo que necesitaría investigarlo más a fondo.

Luego agregó una observación de su artículo del mes pasado sobre un agente de codificación local. En ese momento, analizó por qué Claude Code usa más tokens y descubrió que la diferencia está principalmente en los tokens de entrada, no en los de salida. Es decir, Claude no escribe el doble de contenido. Los registros muestran que la plataforma de Claude reintroduce repetidamente más contexto en el modelo durante múltiples interacciones, incluyendo mensajes previos, llamadas a herramientas, salidas de comandos y contenido de archivos. Por ejemplo, en una ejecución, Claude usó alrededor de 578,000 tokens de entrada, pero solo produjo unos 4,500 tokens de salida, abarcando 25 rondas. Por lo tanto, es más probable que la plataforma de Claude acumule o contabilice un historial de "prompts" más grande durante la ejecución de un agente de múltiples pasos.

Estos resultados de prueba parecen revelar una tendencia innegable: La importancia de la plataforma ("harness") ya no es menor que la del modelo en sí.

Un artículo reciente (de Writer, una empresa que desarrolla una plataforma de agentes de IA empresarial) lo demuestra sistemáticamente: mediante experimentos controlados, muestra que cambiar la capa de la plataforma es más efectivo para reducir costos que cambiar el modelo, y todos los modelos se benefician.

Concretamente, llevaron a cabo un estricto experimento de "control de variables": manteniendo fijas 22 tareas empresariales y 6 modelos base (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), solo reemplazaron la capa de orquestación, sustituyendo el ciclo de agente inteligente de nivel de producción tradicional por su propia plataforma, Writer Harness.

Los resultados mostraron: un costo promedio reducido en un 41% por tarea (de 0.21 a 0.12 dólares), una latencia mediana reducida en un 44% (de 48 a 27 segundos), un consumo de tokens reducido en un 38% (de 14.2k a 8.8k), mientras que la calidad de finalización de la tarea se mantuvo básicamente igual (de 0.78 a 0.81, considerada sin diferencia significativa debido al tamaño de muestra). En cuanto a relación costo-beneficio, la calidad obtenida por dólar aumentó en un impresionante 82%, y el número de tareas completadas por millón de tokens pasó de 54.9 a 92.0.

Entonces, ¿después de que los modelos se convirtieron en "servicios básicos", la plataforma es el "aire acondicionado" que determina tu factura de electricidad? En otras palabras: antes se decía "el modelo es el producto", ¿ahora es "la plataforma es el producto"?

Dado que la plataforma es tan importante, ¿no deberíamos comenzar a hacer cuentas más detalladas?

Alguien señaló que es necesario agregar un ítem de "impuesto de plataforma" a los benchmarks existentes. Especialmente considerando que, una vez que las llamadas a herramientas y los reintentos entran en un bucle, este "impuesto" no crece linealmente.

En otras palabras, la competencia futura de agentes, en la primera mitad se tratará de "quién puede hacerlo", y en la segunda mitad será "quién puede hacer lo mismo gastando menos" — y el secreto para ahorrar no está en el modelo, sino en la plataforma.

¿Has tenido una experiencia similar al ejecutar un Agente? Te invitamos a discutirlo en la sección de comentarios.

Este artículo proviene del WeChat Official Account "机器之心" (ID: almosthuman2014), autor: 机器之心.

Preguntas relacionadas

Q¿Cuál fue el hallazgo principal del experimento de Composio sobre el uso de tokens en diferentes frameworks de agentes?

AEl experimento reveló que el consumo de tokens varía enormemente entre los frameworks. Claude Code usó aproximadamente 6 veces más tokens que Kimi Code, llegando a una diferencia máxima de 30 veces en algunas tareas, a pesar de que las tasas de éxito fueron similares.

QSegún el artículo, ¿cuál es el impacto en costos del alto consumo de tokens de Claude Code?

AUtilizando el precio de Kimi K3 de 3 USD por millón de tokens de entrada, el costo promedio por tarea fue de 0.22 USD para Kimi Code, 0.28 USD para Hermes y 2 USD para Claude Code, mostrando una diferencia significativa en costos.

Q¿Qué explicación sugiere Sebastian Raschka para el alto uso de tokens en Claude Code?

ARaschka señala que la diferencia se debe principalmente a los tokens de entrada, no a los de salida. El harness de Claude parece reinyectar constantemente más contexto en el modelo en interacciones de múltiples pasos, como mensajes anteriores, llamadas a herramientas y salidas de comandos.

Q¿Qué tendencia importante destaca el artículo respecto a los frameworks (harness) y los modelos de IA?

AEl artículo destaca que la importancia del harness ya es comparable a la del modelo en sí. Un buen harness puede reducir costos y latencia de forma más efectiva que cambiar el modelo, como demostró el experimento de Writer, que redujo costos un 41% y la latencia un 44% solo cambiando la capa de orquestación.

Q¿Qué término se propone en el artículo para medir el impacto económico de los diferentes harness en los benchmarks de agentes?

ASe propone incluir un 'impuesto del harness' (harness tax) en los benchmarks existentes. Este concepto reconoce que el costo adicional del harness, especialmente cuando hay bucles de llamadas a herramientas y reintentos, no crece de manera lineal y puede ser un factor económico crucial.

Lecturas Relacionadas

Bitcoin en agosto: los expertos esperan una prueba del rango, no una rápida reversión

**Bitcóin en agosto: expertos esperan prueba del rango, no una rápida reversión** Los analistas prevén que Bitcoin permanezca bajo presión en agosto. Tras la recuperación de julio, el mercado no parece listo para un crecimiento sostenido, y persiste el riesgo de caer por debajo de $60,000. A finales de julio, la principal criptomoneda cotizaba alrededor de $63,500. Los expertos señalan una combinación macroeconómica difícil: altas tasas de interés en EE. UU., inflación persistente y un dólar fuerte, lo que limita el apetito por activos de riesgo como las criptomonedas. Además, se registró una fuerte salida neta de fondos ETF de Bitcoin en el primer semestre. Agosto históricamente es un mes débil para el sector. Los analistas anticipan que será más un período de prueba de niveles clave que de un repunte decisivo. Rufat Abyasov plantea tres escenarios para el mes: movimiento lateral entre $58,000-$68,000 (50% de probabilidad), caída a $50,000-$55,000 (30%), o subida a $71,000-$75,000 (20%). La zona crítica de soporte se sitúa en $60,000-$61,000. Aunque algunos, como Víctor Pershikov, ven posible un repunte a $70,000, se coincide en que el ciclo correctivo probablemente no terminará antes del último trimestre del año. Los inversores deben monitorear las tasas, la inflación, los flujos de los ETF y el interés general por el riesgo. Se recomienda acumulación gradual a largo vista, pero con cautela ante posibles caídas a corto plazo.

cryptonews.ruHace 33 min(s)

Bitcoin en agosto: los expertos esperan una prueba del rango, no una rápida reversión

cryptonews.ruHace 33 min(s)

Billetera de hardware Coldcard hackeada: piratas informáticos retiraron 594 bitcoins en 25 minutos

Las carteras hardware han sido consideradas la forma más segura de almacenar criptomonedas, pero un reciente incidente con los dispositivos Coldcard de Coinkite cuestiona esta idea. El 30 de julio de 2026, atacantes drenaron 594.5 bitcoins (unos $40 millones) de quinientas direcciones en solo veinticinco minutos. La causa fue un error en el código introducido en marzo de 2021 y no detectado durante cinco años. Un error tipográfico en una macro desactivó la función del chip seguro que generaba números aleatorios verdaderos para crear la frase semilla (seed phrase). En su lugar, las claves se generaban usando datos predecibles, como el número de serie del procesor y la hora del sistema, reduciendo drásticamente la entropía y haciéndolas vulnerables a ataques por fuerza bruta offline. Los atacantes no necesitaron acceso físico. Simplemente generaron millones de frases semilla posibles basándose en los parámetros del generador comprometido, las contrastaron con el registro público de la cadena de bloques y firmaron transacciones para robar los fondos. Inicialmente, Coinkite declaró que los modelos nuevos no estaban en riesgo, pero luego reconoció que todos los dispositivos con firmware afectado eran vulnerables. El CEO, Rodolphe Novak (NVK), se disculpó, asumiendo la responsabilidad, pero descartó compensaciones financieras para los usuarios afectados. Los propietarios de dispositivos vulnerables deben actualizar el firmware a una versión segura, generar una NUEVA frase semilla en el dispositivo actualizado y transferir TODOS sus fondos a direcciones derivadas de esta nueva semilla. El uso de una frase de contraseña BIP-39 ayuda, pero no sustituye este proceso. Otros productos de Coinkite (TAPSIGNER, OPENDIME, SATSCARD) no se vieron afectados. El incidente subraya que incluso el hardware especializado requiere auditorías de código independientes y continuas, especialmente en funciones criptográficas críticas.

cryptonews.ruHace 34 min(s)

Billetera de hardware Coldcard hackeada: piratas informáticos retiraron 594 bitcoins en 25 minutos

cryptonews.ruHace 34 min(s)

Trading

Spot
活动图片