¡Programadores de todo el mundo le están regalando dinero a Anthropic! La empresa finalmente no puede soportarlo más

marsbitPublicado a 2026-08-16Actualizado a 2026-08-16

Resumen

Anthropic acaba de publicar un blog revelando seis estrategias clave para que los desarrolladores ahorren costes significativos al usar Claude Code, ya que muchos están gastando innecesariamente en tokens. El costo proviene de los tokens de entrada (más baratos, procesados en paralelo) y salida (5 veces más caros, generados secuencialmente). La herramienta más poderosa es la **caché de prefijo**, que reduce el coste de releer el historial idéntico en un 90%. Sin embargo, acciones como cambiar de modelo (`/model`), ajustar el esfuerzo (`/effort`), comprimir (`/compact`) o dejar pasar el tiempo invalidan esta caché, disparando el coste. El historial de la conversación crece cuadráticamente (O(n²)) porque cada nuevo mensaje reenvía todo lo anterior. Para combatirlo, Anthropic recomienda: 1. **`/clear` al cambiar de tarea** para no arrastrar contexto irrelevante. 2. **Definir modelo y esfuerzo al inicio** y no cambiarlos. 3. **Usar `@` para adjuntar archivos** directamente, evitando búsquedas costosas. 4. **Usar flags `--quiet` en comandos ruidosos** (ej: tests) para minimizar la salida. 5. **Hacer `/compact` mientras la caché está activa** (coste reducido). 6. **Usar subagentes para tareas con mucha salida**, aislando el proceso en una ventana aparte. Dominar estas técnicas—elegir el modelo correcto, gestionar el contexto y preservar la caché—se está convirtiendo en una habilidad esencial para los desarrolladores, permitiendo hacer más con el mismo presupuesto en la era...

Acabamos de recibir una publicación en el blog de Anthropic.

El mensaje central es: ¡Chicos, dejen de malgastar tokens, no podemos seguir viéndolo!

Para ello, la empresa ha detallado seis estrategias para ahorrar dinero:

1. /clear cuando termines una tarea. Después de arreglar un bug, limpia la conversación actual. No dejes que los archivos leídos y las salidas de comandos de la tarea anterior se arrastren a la siguiente, ocupando espacio de contexto innecesariamente.

2. Define el modelo y el nivel de esfuerzo (effort level) desde el principio. Si los cambias a mitad de camino, se invalidará toda la caché de prompts acumulada y todo el historial de la conversación se volverá a calcular a precio completo.

3. Usa @ para referenciar archivos, no escribas la ruta manualmente. Adjunta el archivo directamente al mensaje usando @, así Claude no necesita hacer otra llamada a herramienta para leerlo. Si solo escribes el nombre del archivo, Claude puede buscar primero, abrir varios archivos para probar, y todas esas operaciones entrarán en el historial y se arrastrarán en cada ronda posterior.

4. Añade parámetros silenciosos (quiet flag) a los comandos con mucha salida. Configura algo como --reporter=dot en CLAUDE.md para que la salida de las pruebas sea solo un breve resumen, no cientos de líneas detalladas. A menos salida, menos contexto ocupado.

5. Haz /compact antes de descansar. Comprime la conversación mientras aún está en caché, el coste es solo una décima parte del normal. Si esperas a que la caché expire, tendrás que volver a leerlo todo a precio completo antes de comprimir.

6. Delega tareas con mucha salida a un sub-Agent. El sub-Agent se ejecuta en una ventana de contexto independiente. Cuando termina, solo devuelve la conclusión. Los archivos leídos y las salidas de comandos durante el proceso no entran en tu conversación principal.

La vida de un token

Trabajar con Claude Code implica costes por API según el uso, y suscripciones mensuales que van desde 20 hasta 200 dólares en tres niveles.

Según estimaciones oficiales, los desarrolladores consumen un promedio de 13 dólares diarios en tokens, gastando entre 150 y 250 dólares al mes.

Y eso es solo el promedio. Arreglar el mismo bug con diferentes preguntas puede multiplicar el coste varias veces.

Además, cada ronda de conversación reenvía todo el contenido de todas las rondas anteriores. Cuanto más larga la sesión, más cara es cada ronda.

Para entender en qué se va ese dinero, hay que ver la lógica de precios de los tokens.

Cada vez que escribes un comando en Claude Code, ocurren dos cosas.

La primera se llama prellenado (prefill): el modelo lee de una vez toda tu solicitud, incluyendo el prompt del sistema, CLAUDE.md, tu mensaje y todo lo acumulado en el historial de la conversación. Estos son tokens de entrada.

La segunda se llama decodificación (decode): el modelo genera texto palabra por palabra, incluyendo su razonamiento, llamadas a herramientas y el texto final que ves. Estos son tokens de salida.

La diferencia clave está aquí.

El prellenado es paralelo, procesando todos los tokens de entrada a través de la GPU de una vez. La decodificación es serial, cada token generado requiere una ejecución del modelo. Una respuesta de 200 tokens son 200 operaciones independientes.

Por eso no es difícil entender que los tokens de salida cuesten 5 veces más que los de entrada.

Sobre esta base, la factura final depende de dos cosas.

La primera es el modelo, que determina el precio por token.

Opus 5: Entrada 5$/millón de tokens, Salida 25$.

Sonnet 5: Entrada 2$, Salida 10$.

Haiku 4.5: Entrada 1$, Salida 5$.

La segunda es el nivel de esfuerzo, que determina la cantidad de tokens.

La mayoría de tokens de salida en una sesión son tokens de pensamiento. El nivel de esfuerzo controla esta cantidad. Cuanto más alto el esfuerzo, más piensa el modelo y más tokens de pensamiento genera. La diferencia entre 'max' y 'low' puede ser varias veces.

Usa Sonnet para tareas simples, Opus solo para las difíciles. Gastar en matar moscas a cañonazos es lo más inútil.

La caché de prompts es la mejor herramienta para ahorrar

En el precio de los tokens hay otra variable enorme: la caché.

Cada solicitud de Claude Code comienza con el mismo prefijo: el prompt del sistema, definiciones de herramientas, CLAUDE.md y el historial de la conversación.

Si el prefijo de esta solicitud es idéntico, byte a byte, al de la anterior, el servidor no lo recalcula, sino que carga el resultado del cálculo anterior.

Leer de la caché cuesta solo 0.1 veces el precio normal de entrada, un ahorro directo del 90%.

Escribir en la caché es un poco más caro, hasta 2 veces. Pero la escritura solo ocurre una vez; cada ronda posterior disfruta de la lectura a 0.1 veces.

Pongamos un ejemplo.

Supón que tu historial de conversación tiene 50,000 tokens. Sin caché, cada ronda pagaría precio completo solo por releer esos 50k tokens. Pero si aciertas la caché, esos mismos 50k tokens cuestan solo una décima parte.

En una sesión de 20-30 rondas, el descuento acumulado por aciertos en la caché es astronómico.

Es tu mayor palanca para ahorrar.

Pero la caché tiene una debilidad fatal. Debe coincidir continuamente desde el primer byte de la solicitud. Cualquier cambio en medio, invalida todo lo posterior desde ese punto.

Concretamente, hay seis situaciones:

1. Cambiar de modelo con /model: Cada modelo tiene su caché independiente. Cambiar de Sonnet a Opus hace que todo el historial se prellene de nuevo al precio de Opus, sin descuento.

2. Cambiar el nivel de esfuerzo con /effort: El nivel de esfuerzo también es parte de la clave de caché. Cambiarlo invalida el historial, que se debe recalcular por completo.

3. Activar/desactivar Fast mode: Tiene el mismo efecto que los dos anteriores, la caché se invalida inmediatamente.

4. Comprimir la conversación con /compact: La conversación se reescribe como un resumen, el contenido original ya no coincide y la caché antigua se invalida.

5. Caducidad por tiempo: Para usuarios con suscripción, la caché se mantiene viva 1 hora. Para usuarios de API, por defecto 5 minutos. Pasado ese tiempo, la siguiente ronda se recalcula por completo.

6. Recuperar una sesión antigua: Si ha pasado demasiado tiempo, la caché ya no está, casi seguro que hay que recalcular todo a precio completo.

La mala noticia es que si ocurre cualquiera de estas cosas, todo el historial de la conversación pasa de costar 0.1 veces a costar el precio completo.

La buena noticia es que, sabiendo qué invalida la caché, puedes saber cómo protegerla.

Por ejemplo, fija el modelo y el nivel de esfuerzo al inicio de la sesión y no los cambies. No hagas /compact mientras la caché esté activa, hazlo cuando vayas a descansar.

Aquí hay otra trampa oculta.

El modo opusplan cambia de modelo cada vez que entras o sales del plan. Entrar, invalida la caché. Salir, la invalida de nuevo. Cada salto es un prefill a precio completo.

Tu conversación se está inflando a escondidas

La caché reduce el coste de reenviar el historial a una décima parte.

Pero hay algo en lo que no puede ayudarte: el propio historial se infla ronda tras ronda.

Cada vez que Claude lee un archivo, su contenido se añade a la conversación. Cada vez que Claude ejecuta un comando, su salida también se añade. Desde la ronda en que se añade, todas las siguientes la arrastran consigo.

La ronda 40 de la conversación está reenviando todo el contenido acumulado de las rondas 1 a 39.

Este crecimiento es casi cuadrático, O(n²).

Claude Code tiene un mecanismo de seguridad.

Si la salida de un comando supera los 30,000 caracteres, no se introduce en la conversación, sino que se escribe en un archivo temporal y solo se pone un resumen en la conversación. Pero las salidas por debajo de 30,000 no son controladas.

Por ejemplo, un framework de pruebas que termina e imprime 400 líneas de resultados, cada una con decenas de caracteres, total menos de 30,000, no alcanza el umbral.

Entonces, esas 400 líneas se quedan intactas en el historial de la conversación, y se reenvían en cada ronda posterior.

Para esto, el blog de Anthropic da algunas estrategias prácticas para adelgazar.

1. @ para referenciar archivos.

No escribas rutas manualmente para que Claude las busque. Referenciar con @ adjunta el archivo directamente al mensaje, ahorrando una operación de lectura.

Si solo dices el nombre del archivo, Claude podría hacer primero una búsqueda grep, abrir varios archivos para ver cuál es. Y todos esos intentos entrarán en el historial, aumentando el coste innecesariamente.

2. Añade quiet flag a comandos ruidosos.

Escribe en CLAUDE.md algo como «run tests with npx vitest run --reporter=dot». A partir de entonces, cada ejecución de pruebas mostrará solo unas pocas líneas de puntos, no cientos de líneas detalladas. Un minuto de configuración ahorrará cientos de líneas de contexto en cada sesión.

3. Aísla tareas de gran salida con subagent.

El subagent se ejecuta en su propia ventana de contexto independiente. Cuando termina, solo devuelve la respuesta. Los archivos leídos y las salidas de comandos durante el proceso se descartan. Ideal para tareas como "revisa los registros en busca de anomalías" o "léeme este archivo grande". Solo quieres la conclusión, no el proceso.

Y la más importante de todas.

4. Usa /clear para cambiar de tarea.

Después de arreglar un bug, haz /clear y empieza lo siguiente. Los archivos, salidas de comandos y exploraciones del bug anterior no tienen nada que ver con la siguiente tarea, pero si no los limpias, ocuparán espacio y consumirán tokens en cada ronda posterior.

Si no quieres borrarlo por completo, /compact puede comprimir la conversación en un resumen. De 10,000 a 20,000 tokens se pueden comprimir a 1,000-3,000.

Además, el blog menciona una operación poco conocida pero gratuita: /rewind.

Si las últimas rondas se desvían, /rewind elimina esas rondas, dejando la caché anterior completamente intacta.

Gestionar tokens también es una habilidad del desarrollador

Al desglosar las operaciones anteriores, descubres un patrón. Quienes escriben código están desarrollando un nuevo conjunto de habilidades.

No está relacionado con frameworks o lenguajes, sino con saber qué modelo elegir, cómo gestionar el contexto, cómo proteger la caché, qué nivel de esfuerzo es apropiado.

Estas habilidades no existían hace un año. Pero ahora determinan si gastas 3 o 30 dólares en la misma tarea.

Anthropic es el mejor ejemplo.

Escriben el 80% de su código con IA, la cantidad de fusiones de código se multiplicó por 8 en un año, las pruebas de referencia son 52 veces más rápidas. Usar la IA a este nivel, si nadie gestiona los tokens, solo el coste de inferencia podría agotar el presupuesto.

Desde esta perspectiva, más que trucos para ahorrar dinero, este blog habla de un nuevo instinto que deben desarrollar quienes escriben código en la era de la IA:

Saber qué consume cada una de tus operaciones, saber cómo hacer que el mismo presupuesto rinda más.

Quienes lo entienden, no solo ahorran unos cuantos dólares en tokens.

Referencias:

https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions

Editor: Moisés

Este artículo proviene del canal oficial de WeChat "新智元", autor: ASI启示录

Preguntas relacionadas

Q¿Cuál es el principal consejo de Anthropic para ahorrar costos en Claude Code?

AEl consejo principal es usar /clear después de cada tarea para eliminar el historial de conversación anterior, evitando que archivos leídos o salidas de comandos de tareas pasadas ocupen contexto innecesariamente y aumenten el costo de tokens.

Q¿Por qué es más caro el token de salida que el de entrada?

AEl token de salida es aproximadamente 5 veces más caro porque el proceso de decodificación (generar la respuesta) es secuencial y requiere ejecutar el modelo una vez por cada token, mientras que el prellenado (leer la entrada) es paralelo y procesa todos los tokens de entrada a la vez.

Q¿Qué es la caché de prompts y cómo ayuda a reducir costos?

ALa caché de prompts almacena el resultado computado de prefijos idénticos en solicitudes consecutivas. Si una nueva solicitud comienza exactamente igual que la anterior, se carga la caché a un 10% del costo normal, ahorrando un 90% en tokens de entrada repetidos.

Q¿Qué acciones hacen que la caché de prompts se invalide?

ALa caché se invalida al cambiar de modelo (/model), ajustar el nivel de esfuerzo (/effort), activar/desactivar el modo rápido, comprimir el historial (/compact), cuando la caché expira por tiempo, o al recuperar una conversación antigua. Cualquier cambio rompe la coincidencia y obliga a un prellenado completo.

Q¿Cómo se puede evitar que el historial de conversación crezca demasiado y sea costoso?

AUsando @ para adjuntar archivos directamente en lugar de escribir rutas, añadiendo parámetros silenciosos (quiet flags) a comandos ruidosos, delegando tareas con mucha salida a un subagente, y usando /clear o /compact regularmente para eliminar o resumir contenido irrelevante.

Lecturas Relacionadas

Pax Silica contra WAICO: EE.UU. quiere prohibir a Europa usar inteligencia artificial china

Estados Unidos exige a sus socios europeos y globales que abandonen las iniciativas chinas en inteligencia artificial, amenazando con expulsarlos de su alianza tecnológica Pax Silica, según un borrador filtrado del Departamento de Estado. La advertencia, dirigida a los 35 signatarios de la "Declaración sobre Oportunidades de IA" (junio 2026), establece una lealtad exclusiva y apunta claramente a China, aunque no la nombre. Esta presión obliga a los países, especialmente a los europeos que buscan autonomía estratégica, a elegir entre el ecosistema tecnológico occidental liderado por EE.UU. y las alternativas. Paralelamente, China, Rusia y otros 27 países fundaron en julio de 2026 la Organización Mundial para la Cooperación en Inteligencia Artificial (WAICO), con sede en Shanghái, presentándola como una plataforma de gobernanza global independiente. Este movimiento crea una arquitectura internacional rival, arriesgando la fragmentación del espacio tecnológico mundial en dos bloques con estándares potencialmente incompatibles. La situación marca una transición de la competencia de mercado a la confrontación geopolítica, donde la tecnología es el principal instrumento de influencia. La elección de los países entre Pax Silica y WAICO configurará la economía digital global durante décadas, priorizando la soberanía tecnológica sobre la eficiencia económica y forzando a las empresas a dividir sus cadenas de suministro según líneas políticas.

cryptonews.ruHace 3 hora(s)

Pax Silica contra WAICO: EE.UU. quiere prohibir a Europa usar inteligencia artificial china

cryptonews.ruHace 3 hora(s)

El CEO de Etherealize califica los blockchains cerrados de Wall Street como una 'carrera hacia el abismo'

El cofundador y CEO de Etherealize, Vivek Raman, ha criticado en una entrevista con CoinDesk el creciente interés de Wall Street por las blockchains privadas o de acceso restringido. Raman argumenta que estas redes consorciales fragmentan la liquidez y reintroducen sistemas aislados, precisamente lo que la tecnología blockchain pretendía superar. Calificó esta nueva ola de proyectos como una "carrera hacia el abajo". Según Raman, estos circuitos cerrados no interactúan entre sí y socavan dos ventajas clave de la tecnología: la interoperabilidad y la concentración de liquidez. En su lugar, Etherealize promueve Ethereum como una capa base abierta para actores institucionales. Insiste en que la privacidad y las restricciones de acceso deben construirse sobre una infraestructura pública, en el nivel de aplicación o en soluciones de Capa 2 (L2), en lugar de crear redes privadas separadas. Comparó Ethereum con HTTP como base, y las capas adicionales con acceso restringido y privacidad, con HTTPS. Como ejemplos de esta tendencia, citó Canton Network de Digital Asset, el proyecto Arc de Circle y Tempo de Stripe, a los que se refirió como "blockchains consorciales 2.0", recordando iniciativas anteriores como R3 e Hyperledger que no lograron un desarrollo significativo desde 2016. Raman reafirmó la convicción de su empresa en la necesidad de una infraestructura global, abierta y sin permiso (permissionless) como capa fundamental.

cryptonews.ruHace 5 hora(s)

El CEO de Etherealize califica los blockchains cerrados de Wall Street como una 'carrera hacia el abismo'

cryptonews.ruHace 5 hora(s)

Trading

Spot
活动图片