
Acabamos de recibir una publicación en el blog de Anthropic.
El mensaje central es: ¡Chicos, dejen de malgastar tokens, no podemos seguir viéndolo!

Para ello, la empresa ha detallado seis estrategias para ahorrar dinero:
1. /clear cuando termines una tarea. Después de arreglar un bug, limpia la conversación actual. No dejes que los archivos leídos y las salidas de comandos de la tarea anterior se arrastren a la siguiente, ocupando espacio de contexto innecesariamente.
2. Define el modelo y el nivel de esfuerzo (effort level) desde el principio. Si los cambias a mitad de camino, se invalidará toda la caché de prompts acumulada y todo el historial de la conversación se volverá a calcular a precio completo.
3. Usa @ para referenciar archivos, no escribas la ruta manualmente. Adjunta el archivo directamente al mensaje usando @, así Claude no necesita hacer otra llamada a herramienta para leerlo. Si solo escribes el nombre del archivo, Claude puede buscar primero, abrir varios archivos para probar, y todas esas operaciones entrarán en el historial y se arrastrarán en cada ronda posterior.
4. Añade parámetros silenciosos (quiet flag) a los comandos con mucha salida. Configura algo como --reporter=dot en CLAUDE.md para que la salida de las pruebas sea solo un breve resumen, no cientos de líneas detalladas. A menos salida, menos contexto ocupado.
5. Haz /compact antes de descansar. Comprime la conversación mientras aún está en caché, el coste es solo una décima parte del normal. Si esperas a que la caché expire, tendrás que volver a leerlo todo a precio completo antes de comprimir.
6. Delega tareas con mucha salida a un sub-Agent. El sub-Agent se ejecuta en una ventana de contexto independiente. Cuando termina, solo devuelve la conclusión. Los archivos leídos y las salidas de comandos durante el proceso no entran en tu conversación principal.

La vida de un token
Trabajar con Claude Code implica costes por API según el uso, y suscripciones mensuales que van desde 20 hasta 200 dólares en tres niveles.
Según estimaciones oficiales, los desarrolladores consumen un promedio de 13 dólares diarios en tokens, gastando entre 150 y 250 dólares al mes.
Y eso es solo el promedio. Arreglar el mismo bug con diferentes preguntas puede multiplicar el coste varias veces.
Además, cada ronda de conversación reenvía todo el contenido de todas las rondas anteriores. Cuanto más larga la sesión, más cara es cada ronda.
Para entender en qué se va ese dinero, hay que ver la lógica de precios de los tokens.

Cada vez que escribes un comando en Claude Code, ocurren dos cosas.
La primera se llama prellenado (prefill): el modelo lee de una vez toda tu solicitud, incluyendo el prompt del sistema, CLAUDE.md, tu mensaje y todo lo acumulado en el historial de la conversación. Estos son tokens de entrada.
La segunda se llama decodificación (decode): el modelo genera texto palabra por palabra, incluyendo su razonamiento, llamadas a herramientas y el texto final que ves. Estos son tokens de salida.
La diferencia clave está aquí.
El prellenado es paralelo, procesando todos los tokens de entrada a través de la GPU de una vez. La decodificación es serial, cada token generado requiere una ejecución del modelo. Una respuesta de 200 tokens son 200 operaciones independientes.
Por eso no es difícil entender que los tokens de salida cuesten 5 veces más que los de entrada.

Sobre esta base, la factura final depende de dos cosas.
La primera es el modelo, que determina el precio por token.
Opus 5: Entrada 5$/millón de tokens, Salida 25$.
Sonnet 5: Entrada 2$, Salida 10$.
Haiku 4.5: Entrada 1$, Salida 5$.
La segunda es el nivel de esfuerzo, que determina la cantidad de tokens.
La mayoría de tokens de salida en una sesión son tokens de pensamiento. El nivel de esfuerzo controla esta cantidad. Cuanto más alto el esfuerzo, más piensa el modelo y más tokens de pensamiento genera. La diferencia entre 'max' y 'low' puede ser varias veces.
Usa Sonnet para tareas simples, Opus solo para las difíciles. Gastar en matar moscas a cañonazos es lo más inútil.

La caché de prompts es la mejor herramienta para ahorrar
En el precio de los tokens hay otra variable enorme: la caché.
Cada solicitud de Claude Code comienza con el mismo prefijo: el prompt del sistema, definiciones de herramientas, CLAUDE.md y el historial de la conversación.
Si el prefijo de esta solicitud es idéntico, byte a byte, al de la anterior, el servidor no lo recalcula, sino que carga el resultado del cálculo anterior.
Leer de la caché cuesta solo 0.1 veces el precio normal de entrada, un ahorro directo del 90%.
Escribir en la caché es un poco más caro, hasta 2 veces. Pero la escritura solo ocurre una vez; cada ronda posterior disfruta de la lectura a 0.1 veces.
Pongamos un ejemplo.
Supón que tu historial de conversación tiene 50,000 tokens. Sin caché, cada ronda pagaría precio completo solo por releer esos 50k tokens. Pero si aciertas la caché, esos mismos 50k tokens cuestan solo una décima parte.
En una sesión de 20-30 rondas, el descuento acumulado por aciertos en la caché es astronómico.
Es tu mayor palanca para ahorrar.

Pero la caché tiene una debilidad fatal. Debe coincidir continuamente desde el primer byte de la solicitud. Cualquier cambio en medio, invalida todo lo posterior desde ese punto.
Concretamente, hay seis situaciones:
1. Cambiar de modelo con /model: Cada modelo tiene su caché independiente. Cambiar de Sonnet a Opus hace que todo el historial se prellene de nuevo al precio de Opus, sin descuento.
2. Cambiar el nivel de esfuerzo con /effort: El nivel de esfuerzo también es parte de la clave de caché. Cambiarlo invalida el historial, que se debe recalcular por completo.
3. Activar/desactivar Fast mode: Tiene el mismo efecto que los dos anteriores, la caché se invalida inmediatamente.
4. Comprimir la conversación con /compact: La conversación se reescribe como un resumen, el contenido original ya no coincide y la caché antigua se invalida.
5. Caducidad por tiempo: Para usuarios con suscripción, la caché se mantiene viva 1 hora. Para usuarios de API, por defecto 5 minutos. Pasado ese tiempo, la siguiente ronda se recalcula por completo.
6. Recuperar una sesión antigua: Si ha pasado demasiado tiempo, la caché ya no está, casi seguro que hay que recalcular todo a precio completo.
La mala noticia es que si ocurre cualquiera de estas cosas, todo el historial de la conversación pasa de costar 0.1 veces a costar el precio completo.
La buena noticia es que, sabiendo qué invalida la caché, puedes saber cómo protegerla.
Por ejemplo, fija el modelo y el nivel de esfuerzo al inicio de la sesión y no los cambies. No hagas /compact mientras la caché esté activa, hazlo cuando vayas a descansar.
Aquí hay otra trampa oculta.
El modo opusplan cambia de modelo cada vez que entras o sales del plan. Entrar, invalida la caché. Salir, la invalida de nuevo. Cada salto es un prefill a precio completo.
Tu conversación se está inflando a escondidas
La caché reduce el coste de reenviar el historial a una décima parte.
Pero hay algo en lo que no puede ayudarte: el propio historial se infla ronda tras ronda.
Cada vez que Claude lee un archivo, su contenido se añade a la conversación. Cada vez que Claude ejecuta un comando, su salida también se añade. Desde la ronda en que se añade, todas las siguientes la arrastran consigo.
La ronda 40 de la conversación está reenviando todo el contenido acumulado de las rondas 1 a 39.
Este crecimiento es casi cuadrático, O(n²).

Claude Code tiene un mecanismo de seguridad.
Si la salida de un comando supera los 30,000 caracteres, no se introduce en la conversación, sino que se escribe en un archivo temporal y solo se pone un resumen en la conversación. Pero las salidas por debajo de 30,000 no son controladas.
Por ejemplo, un framework de pruebas que termina e imprime 400 líneas de resultados, cada una con decenas de caracteres, total menos de 30,000, no alcanza el umbral.
Entonces, esas 400 líneas se quedan intactas en el historial de la conversación, y se reenvían en cada ronda posterior.
Para esto, el blog de Anthropic da algunas estrategias prácticas para adelgazar.
1. @ para referenciar archivos.
No escribas rutas manualmente para que Claude las busque. Referenciar con @ adjunta el archivo directamente al mensaje, ahorrando una operación de lectura.
Si solo dices el nombre del archivo, Claude podría hacer primero una búsqueda grep, abrir varios archivos para ver cuál es. Y todos esos intentos entrarán en el historial, aumentando el coste innecesariamente.

2. Añade quiet flag a comandos ruidosos.
Escribe en CLAUDE.md algo como «run tests with npx vitest run --reporter=dot». A partir de entonces, cada ejecución de pruebas mostrará solo unas pocas líneas de puntos, no cientos de líneas detalladas. Un minuto de configuración ahorrará cientos de líneas de contexto en cada sesión.
3. Aísla tareas de gran salida con subagent.
El subagent se ejecuta en su propia ventana de contexto independiente. Cuando termina, solo devuelve la respuesta. Los archivos leídos y las salidas de comandos durante el proceso se descartan. Ideal para tareas como "revisa los registros en busca de anomalías" o "léeme este archivo grande". Solo quieres la conclusión, no el proceso.

Y la más importante de todas.
4. Usa /clear para cambiar de tarea.
Después de arreglar un bug, haz /clear y empieza lo siguiente. Los archivos, salidas de comandos y exploraciones del bug anterior no tienen nada que ver con la siguiente tarea, pero si no los limpias, ocuparán espacio y consumirán tokens en cada ronda posterior.
Si no quieres borrarlo por completo, /compact puede comprimir la conversación en un resumen. De 10,000 a 20,000 tokens se pueden comprimir a 1,000-3,000.

Además, el blog menciona una operación poco conocida pero gratuita: /rewind.
Si las últimas rondas se desvían, /rewind elimina esas rondas, dejando la caché anterior completamente intacta.

Gestionar tokens también es una habilidad del desarrollador
Al desglosar las operaciones anteriores, descubres un patrón. Quienes escriben código están desarrollando un nuevo conjunto de habilidades.
No está relacionado con frameworks o lenguajes, sino con saber qué modelo elegir, cómo gestionar el contexto, cómo proteger la caché, qué nivel de esfuerzo es apropiado.
Estas habilidades no existían hace un año. Pero ahora determinan si gastas 3 o 30 dólares en la misma tarea.
Anthropic es el mejor ejemplo.
Escriben el 80% de su código con IA, la cantidad de fusiones de código se multiplicó por 8 en un año, las pruebas de referencia son 52 veces más rápidas. Usar la IA a este nivel, si nadie gestiona los tokens, solo el coste de inferencia podría agotar el presupuesto.
Desde esta perspectiva, más que trucos para ahorrar dinero, este blog habla de un nuevo instinto que deben desarrollar quienes escriben código en la era de la IA:
Saber qué consume cada una de tus operaciones, saber cómo hacer que el mismo presupuesto rinda más.
Quienes lo entienden, no solo ahorran unos cuantos dólares en tokens.
Referencias:
https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions
Editor: Moisés
Este artículo proviene del canal oficial de WeChat "新智元", autor: ASI启示录





