Todos cotizan a 5 dólares, la factura difiere un 30%: Ejecutivo de OpenAI: Los tokens nunca se pueden comparar directamente

marsbitPublicado a 2026-08-19Actualizado a 2026-08-19

Resumen

El mismo texto puede generar 766 tokens con GPT-5.6 Sol y 1170 tokens con Claude Opus 5, aunque ambas empresas cobren 5 USD por millón de tokens. Esto demuestra que un token no es una unidad estándar; cada modelo tiene su propio "tokenizador" para dividir el texto, lo que afecta directamente el coste final. Incluso dentro de una misma empresa, como Anthropic, los modelos más nuevos (Claude 4.7+) usan un 30% más de tokens para la misma entrada que los antiguos. Por lo tanto, comparar solo el precio por token es engañoso. La factura real depende de varios factores: la eficiencia del tokenizador, el uso de caché (mucho más barato), el precio de los tokens de salida (más caros y cruciales en flujos de agentes) y las tarifas adicionales por contextos largos (por ejemplo, GPT-5.6 Sol duplica el precio de entrada si se superan los 272K tokens). Configurar manualmente una ventana de contexto grande (ej. 1 millón de tokens) no incurre en costes inmediatos, pero aumenta la probabilidad de alcanzar umbrales de precios más altos en conversaciones largas, ya que cada solicitud reprocesa todo el historial. La conclusión clave es que la métrica relevante no es el "precio por millón de tokens", sino el "coste por resultado exitoso". La recomendación es probar con cargas de trabajo reales, calculando los tokens reales usados y considerando todos los factores de pricing, para determinar qué modelo es realmente más económico para una tarea específica.

Un mismo texto, pasándoselo a dos modelos, uno lo divide en 766 tokens y otro en 1170.

Quién lanza estos números es Tibo, responsable de OpenAI Codex.

Sus palabras exactas fueron: Un token de OpenAI no equivale a un token de otro modelo. Un precio más bajo por token individual no significa necesariamente una factura más baja.

Todos comparan precios usando "dólares por millón de tokens", como si el token fuera una unidad estándar como el gramo o el kilovatio-hora, pero no lo es.

Para que sea más fácil de entender, también contó una historia sobre pizza.

Dos pizzas idénticas.

La primera la corta en 8 porciones, cada una a 2 dólares. La segunda la corta en 16 porciones, cada una a 1.25 dólares. El segundo establecimiento anuncia un precio más bajo en su cartel, pero comer la pizza entera cuesta 20 dólares, mientras que la primera solo 16 dólares.

Añadió: A tu estómago no le importa cuántas porciones acabas de comer.

Cada porción es más barata, pero la pizza entera resulta más cara. Con métodos de corte diferentes, el precio unitario pierde su comparabilidad.

El token es la unidad mínima de facturación del modelo. Se puede entender como la "técnica de corte" que el modelo aplica al texto.

Para un mismo párrafo, con técnicas de corte diferentes, el número de piezas resultante será diferente. Se cobra por la cantidad de piezas. Cuantas más piezas, más cara será la factura.

Esta comparativa abarca inglés, textos técnicos, contenido multilingüe y numérico.

El tokenizador de GPT-5.6 Sol utilizó 766 tokens, mientras que la estimación para Claude Opus 5 fue de 1170.

Para el mismo texto, la "técnica de corte" de GPT-5.6 Sol produjo un 34.5% menos de piezas.

Y el precio de entrada de ambos modelos es de 5 dólares por millón de tokens.

El precio unitario es exactamente el mismo, el número de piezas es un tercio menor, y el coste de entrada también se reduce en un tercio.

El problema está precisamente aquí.

Si ni siquiera se puede alinear algo tan básico como "qué tamaño tiene un token" entre dos proveedores, ¿hasta qué punto sigue siendo válida esa tabla comparativa de precios de APIs que todos comparten a diario?

¿Por qué dos números para un mismo texto?

Esto se debe a que la unidad "token" simplemente no tiene una medida unificada.

Cada proveedor entrena su propio tokenizador y decide en qué tamaño fragmentar el texto.

Para palabras comunes, el tokenizador las consume enteras; para palabras raras, una sola palabra puede dividirse en tres o cuatro piezas.

El inglés es el ejemplo más claro. Palabras como "the", "and", "is" aparecen constantemente, el tokenizador les asigna un código único a cada una, una palabra es un token.

Con una palabra larga como "unbelievable", hay que dividirla en "un", "believ", "able", por lo que una palabra ocupa tres tokens.

La lógica es simple: el tokenizador se basa en estadísticas del corpus de entrenamiento. Las combinaciones que aparecen con frecuencia obtienen su propia posición. El resto se tiene que ensamblar con fragmentos.

Por lo tanto, "cuántos tokens tiene un párrafo" esencialmente pregunta "¿con qué frecuencia aparecen las cosas en este párrafo dentro del corpus de este proveedor?".

Y la prosa en inglés es, precisamente, el tipo de contenido con menor variación. Para código, JSON, cadenas largas de números, la diferencia entre lo que cortan dos proveedores será aún mayor.

Ni siquiera los modelos antiguos y nuevos de un mismo proveedor tienen cuentas compatibles

Esto no es un problema exclusivo de un solo proveedor.

La propia documentación de Anthropic es clara: el conteo de tokens es una estimación, la cantidad real de tokens de entrada utilizados al crear un mensaje puede tener pequeñas discrepancias.

Incluso da un número concreto.

Los modelos Claude 4.7 y posteriores utilizan un nuevo tokenizador. Para el mismo texto de entrada, producen aproximadamente un 30% más de tokens que los modelos iniciales, y el aumento específico depende del contenido y del tipo de carga de trabajo.

Documentación oficial de Anthropic: Los modelos Claude 4.7 y posteriores usan un nuevo tokenizador. El mismo texto produce aproximadamente un tercio más de tokens; no reutilicen los recuentos medidos en modelos antiguos.

La misma compañía, el mismo texto, y después de una generación hay un tercio más.

Por eso su recomendación oficial es: si quieres saber cuánta diferencia hay en tu carga de trabajo, procesa la misma petición con ambos modelos y compara los `input_tokens` devueltos.

No uses los números medidos en modelos antiguos para estimar costes.

Ni siquiera los recuentos entre dos generaciones de modelos de la misma casa se pueden reutilizar. Comparar directamente el "precio por millón de tokens" entre proveedores está aún más lejos de ser estandarizado.

Ambos a 5 dólares, la factura difiere en cuatro aspectos

Mismo precio unitario, misma entrada, ¿dónde está exactamente la diferencia en la factura?

Primero, la eficiencia del tokenizador, ya mencionada. El mismo texto genera un número diferente de tokens. Multiplicado por el mismo precio unitario, el dinero pagado naturalmente será diferente.

Segundo, la caché.

El precio de entrada con caché de GPT-5.6 Sol es de 0.50 dólares por millón de tokens, solo una décima parte del precio de entrada estándar. Para cargas de trabajo con muchos prefijos repetidos, este ítem puede cambiar por completo la estructura de la factura.

Tercero, la salida.

La salida de GPT-5.6 Sol es de 30 dólares por millón de tokens; la de Claude Opus 5 empieza en 25 dólares.

Y en flujos de trabajo reales de agentes inteligentes, el peso de los tokens de salida suele ser aún mayor que el de la entrada.

Es decir, ese 34.5% ahorrado al principio puede recuperarse aquí con creces.

Cuarto, el más fácil de pasar por alto, está escrito en la propia página del modelo de OpenAI. Cuando la entrada de GPT-5.6 Sol supera los 272K tokens, toda la petición se factura al doble para la entrada y al 1.5 veces para la salida.

Página oficial del modelo GPT-5.6 Sol: Entrada 5$, Entrada en caché 0.50$, Salida 30$. Esa línea pequeña de abajo especifica las reglas de recargo por superar los 272K.

No es solo la parte que excede la que se recarga, es toda la petición la que se somete a la tarifa superior.

El mismo fragmento de código, si lo consultas en un contexto de 270 mil tokens o en uno de 280 mil tokens, el precio unitario cambia de nivel.

Esta limitación proviene de la propia página de precios oficial. A mayor longitud de contexto, más rápidamente aumentan los costes de atención y memoria gráfica; las ventanas largas nunca han sido gratuitas.

La ventana de un millón está abierta, el dinero se va gastando poco a poco

Después, Tibo publicó un segundo mensaje, enseñando cómo configurar manualmente la ventana de contexto al máximo en Codex.

Abre ~/.codex/config.toml y añade tres líneas antes de cualquier título de sección:

model = "gpt-5.6-sol"

model_context_window = 1000000

model_auto_compact_token_limit = 900000

La primera línea selecciona el modelo, la segunda establece el presupuesto de contexto en 1 millón de tokens, la tercera activa la compresión automática alrededor de los 900 mil tokens, dejando un margen.

Guarda, reinicia el cliente y abre una nueva sesión para que la configuración surta efecto.

Si no quieres cambiar los valores por defecto, también puedes anularlos temporalmente solo para una sesión CLI:

codex -m gpt-5.6-sol

-c model_context_window=1000000

-c model_auto_compact_token_limit=900000

Estas dos claves se pueden consultar en la referencia de configuración oficial de Codex y su función coincide con lo que él escribió.

`model_context_window`, el número de tokens de la ventana de contexto disponible para el modelo actual.

`model_auto_compact_token_limit`, el umbral para activar la compresión automática del historial.

Pero la documentación solo define el significado de las claves, no lista "1 millón / 900 mil" como valores recomendados universales.

El propio Tibo añadió al final de su publicación: Los valores por defecto están cuidadosamente ajustados.

Entonces, ¿por qué tanta gente quiere cambiarlos manualmente?

Un informe de pruebas de usuario en GitHub explica la razón.

Este informe de pruebas en el repositorio openai/codex: El directorio de Codex limita la ventana a 372K, efectivos 353.4K, mientras que las especificaciones del modelo indican 1.05M

En una versión específica del cliente Codex y con una cuenta ChatGPT Pro, el directorio de modelos mostraba para gpt-5.6-sol una ventana de 372K, aplicando un 95%, quedaban 353.4K utilizables. Pero la página oficial del modelo indica 1.05M.

Compraste una ventana de un millón, pero al usarla solo te queda un tercio.

Este informe tiene limitaciones claras de versión y tipo de cuenta, no puede tomarse como la situación actual de todos los usuarios. Además, la publicación de configuración de Tibo es más reciente.

Hay que aclarar algo: configurar a 1 millón no genera inmediatamente un coste por 1 millón de tokens. Lo que se factura siempre es el volumen de procesamiento real.

Sin embargo, llevar el umbral de compresión hasta los 900 mil significa que una sesión larga arrastrará un historial cada vez más extenso, y cada nueva petición tendrá que procesar de nuevo ese historial.

Cuanto mayor sea la ventana y más tarde se comprima, más probable es que la petición alcance ese umbral de 272K mencionado antes.

En conversaciones cortas, las diferencias del tokenizador son minúsculas. Cuando una sesión se extiende a cientos de miles de tokens, arrastrando y reprocesando el historial repetidamente, multiplicado además por una tarifa superior, los decimales de la diferencia se convierten en números enteros.

El dinero no se gasta de golpe, sino que aumenta ronda tras ronda.

La próxima unidad es "por resultado exitoso"

En la publicación de Tibo había otra frase que pasó desapercibida entre los números: Lo que realmente importa es el coste por resultado exitoso (price per successful outcome).

Y también dio el método. Los benchmarks pueden ser un punto de partida, pero para saber realmente si es caro, hay que ejecutar tu propio trabajo.

Esta frase cambia el punto de referencia de la comparación de precios. De "cuánto cuesta un millón de tokens" a "cuánto cuesta en total completar la misma tarea".

Para saber cuál de los dos proveedores es realmente más barato para ti, pruébalo tú mismo.

Toma el mismo texto original, la misma proporción de idiomas, las mismas definiciones de herramientas; llama a las interfaces oficiales de conteo de cada proveedor para obtener el número real de tokens; luego incluye aciertos de caché, longitud de salida, longitud de inferencia y recargos por contexto largo; finalmente, compara cuál completa el trabajo con un coste menor.

La eficiencia del tokenizador es solo el primer eslabón de esta cadena. Un modelo que ahorra en tokenización, si es verboso en el razonamiento o requiere muchos reintentos, puede perfectamente revertir la factura y superar al otro.

En el futuro, la pregunta no debería ser cuánto cuesta un millón de tokens, sino cuánto cuesta arreglar este bug.

Referencias:

https://x.com/thsottiaux/status/2089082893804896524?s=20

https://x.com/thsottiaux/status/2088866513008873560?s=20 https://github.com/openai/codex/issues/31860

Este artículo proviene del WeChat Official Account "新智元", autor: ASI启示录

Criptos en tendencia

Preguntas relacionadas

QSegún el artículo, ¿por qué no se pueden comparar directamente los precios de los tokens entre diferentes modelos de IA?

APorque el 'token' no es una unidad de medida estandarizada como un gramo o un kilovatio-hora. Cada proveedor entrena su propio 'tokenizador', que divide el texto en fragmentos de diferentes tamaños, por lo que el mismo texto puede generar un número de tokens distinto en cada modelo, lo que afecta directamente el costo final.

Q¿Qué analogía utiliza el artículo para explicar que un precio más bajo por token no significa una factura total más baja?

AUtiliza la analogía de la pizza: dos pizzas idénticas, una cortada en 8 porciones a $2 cada una (total $16) y otra cortada en 16 porciones a $1.25 cada una (total $20). Aunque cada porción de la segunda es más barata, la pizza entera cuesta más porque tiene más porciones. Tu estómago no se preocupa por cuántas porciones comiste.

QSegún el artículo, además de la eficiencia del tokenizador, ¿qué otros factores pueden hacer que la factura de dos modelos con el mismo precio por token sea diferente?

ACuatro factores principales: 1) La eficiencia del tokenizador (número de tokens generados). 2) El uso de caché (que puede reducir drásticamente el coste de los tokens de entrada repetidos). 3) El coste de los tokens de salida (que puede ser diferente y tener un gran peso en flujos de trabajo de agentes). 4) Las tarifas adicionales por contexto largo (como en GPT-5.6 Sol, donde superar cierto umbral de tokens duplica el precio de toda la solicitud).

Q¿Qué problema se menciona en el artículo incluso al comparar modelos antiguos y nuevos de la misma empresa, como Anthropic?

AQue incluso dentro de la misma empresa, los contadores de tokens no son compatibles. Por ejemplo, los modelos Claude 4.7 y posteriores usan un nuevo tokenizador que genera aproximadamente un 30% más de tokens para el mismo texto de entrada en comparación con los modelos anteriores. Por lo tanto, no se pueden reutilizar los recuentos de un modelo antiguo para estimar el costo de uno nuevo.

Q¿Cuál es, según Tibo de OpenAI, la métrica más importante que los usuarios deberían considerar al comparar costos, en lugar del 'precio por millón de tokens'?

ALa métrica más importante es el 'costo por resultado exitoso' (price per successful outcome). En lugar de comparar precios por token, los usuarios deberían probar cuánto les cuesta completar la misma tarea específica (como arreglar un error en el código) con diferentes modelos, teniendo en cuenta todos los factores como la eficiencia del tokenizador, la longitud de la salida, las retransmisiones y las tarifas por contexto largo.

Lecturas Relacionadas

El miedo por el déficit de 1.8 billones se intensifica: el aumento de los rendimientos de los bonos podría provocar una volatilidad del 30% en Bitcoin

Desde junio, el mercado de bitcoin se mantiene en una rara fase lateral con baja volatilidad, aunque se espera un "catalizador" que rompa la inercia. A pesar del optimismo de figuras como Robert Mitchnick de BlackRock y las fuertes entradas netas en los ETF de bitcoin en EE.UU., el precio no logra escapar del rango actual. Dos factores macroeconómicos opuestos están tensionando el mercado. Por un lado, el déficit fiscal de EE.UU., con un gap de 1,8 billones de dólares, aviva las expectativas de mayor impresión monetaria, lo que según inversores como Anthony Pompliano y Arthur Hayes beneficiaría a activos como bitcoin a largo plazo. Por otro, los rendimientos de los bonos se disparan, con el bono a 30 años en máximos desde 2002, presionando a los activos de riesgo debido al mayor costo del dinero. Sean Farrell de Fundstrat señala que la volatilidad actual del bitcoin es extremadamente baja y, históricamente, esto ha precedido movimientos de precios absolutos de alrededor del 30% en 60 días (tanto al alza como a la baja). Destaca que la posible continuación del alza en los rendimientos reales de los bonos podría ser el detonante. El enfoque del mercado ha pasado de la política de tasas de la Fed a la tendencia de los rendimientos a largo plazo, los riesgos geopolíticos y la inflación. En este escenario de riesgos duales, los participantes se preparan para una posible corrección profunda, con algunos analistas, como Robin Singh de Koinly, que no descartan una caída hacia los 55.000 dólares antes de un posible fondo del ciclo. En resumen, mientras la narrativa de expansión monetaria ofrece un soporte alcista a mediano plazo, el alza en los rendimientos de los bonos ejerce una presión bajista inmediata. La estructura del mercado, con vendedores exhaustos y compradores a la espera, es inestable. La probabilidad de una volatilidad significativa (aproximadamente ±30%) en los próximos dos meses es alta, requiriendo una gestión de riesgo cautelosa.

marsbitJusto ahora

El miedo por el déficit de 1.8 billones se intensifica: el aumento de los rendimientos de los bonos podría provocar una volatilidad del 30% en Bitcoin

marsbitJusto ahora

OpenAI desvela 4+10 pautas de supervivencia específicas para ataques automatizados de IA

**OpenAI revela 4+10 guías de supervivencia contra ataques automatizados de IA** Tras un incidente de seguridad en Hugging Face, donde un agente de IA explotó vulnerabilidades para infiltrarse en sistemas de producción, OpenAI advierte: **la IA está reduciendo drásticamente el umbral de los ciberataques**, automatizando el lado ofensivo mientras la defensa se queda atrás. En respuesta, Greg Brockman, cofundador de OpenAI, comparte medidas clave. **OpenAI se protege usando IA**: emplea Codex para revisar código, clasifica alertas con IA, busca proactivamente rutas de ataque y refuerza medidas de seguridad tradicionales. Para otros defensores, Brockman ofrece **10 acciones prácticas** en tres pasos: 1. **Integrar la IA en la seguridad**: Dotar a los equipos de agentes especializados (como Codex Security) y entrenarlos con conocimientos específicos de la empresa. 2. **Incrustar la IA en el desarrollo**: Usar agentes para revisar código, priorizar alertas y generar parches, acelerando la reparación. 3. **Automatizar gradualmente**: Comenzar con permisos de solo lectura para los agentes, escalando hacia un sistema operativo de seguridad autónomo. Brockman enfatiza que **ninguna empresa puede enfrentar este desafío sola**. Hace un llamado a la colaboración del ecosistema (laboratorios de IA, empresas de seguridad, proyectos de código abierto) para **compartir vulnerabilidades, parches y mejores prácticas**, transformando la experiencia individual en defensa colectiva. La ventana para que los defensores actúen está abierta: el objetivo es convertir a la IA en un escudo, no en un punto débil.

marsbitHace 34 min(s)

OpenAI desvela 4+10 pautas de supervivencia específicas para ataques automatizados de IA

marsbitHace 34 min(s)

Trading

Spot

Artículos destacados

Cómo comprar BILL

¡Bienvenido a HTX.com! Hemos hecho que comprar Billions Network (BILL) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Billions Network (BILL) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Billions Network (BILL)Después de comprar tu Billions Network (BILL), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Billions Network (BILL)Tradear fácilmente con Billions Network (BILL) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

881 Vistas totalesPublicado en 2026.05.07Actualizado en 2026.06.02

Cómo comprar BILL

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de BILL (BILL).

活动图片