El mismo modelo, su precio oficial solo bajó un 20%, pero tu factura se redujo un 80%.

El 24 de agosto, OpenAI publicó los resultados de una prueba realizada conjuntamente con AWS:
En Terminal-Bench 2.1, el coste de que GPT-5.6 Terra complete una tarea con éxito en Kiro se redujo aproximadamente un 82%.
Kiro es la plataforma de agentes inteligentes de desarrollo de software de AWS, que cubre IDE, CLI y web.
Los tres hermanos de la familia GPT-5.6, Sol, Terra y Luna, han estado ejecutándose allí durante más de un mes.
Este 82% no es una reducción de precio oficial.
El último ajuste de precio de Terra fue el 30 de julio, con una reducción del 20%.

Anuncio de ajuste de precios de OpenAI del 30 de julio, Terra baja un 20%.
El precio unitario solo bajó un 20%, pero la factura se puede reducir un 80%.
De dónde proviene el ahorro del sesenta por ciento adicional en el medio es lo que realmente merece nuestra atención.
GPT-5.6 llegó a Kiro en julio de este año.
Primero, el día 13, AWS anunció que GPT-5.6 Sol, Terra y Luna estaban oficialmente disponibles en Amazon Bedrock.
Al día siguiente, Kiro publicó una entrada en el blog anunciando que los tres modelos estaban disponibles en IDE, CLI y web.

Esta fue la primera vez que un modelo de OpenAI entraba en Kiro, justo para coincidir con el primer aniversario de la vista previa pública de Kiro.
Primero se colocaron los modelos en el estante, luego se llevaron a trabajar. Más de un mes después, OpenAI volvió a presentar resultados:
Las dos empresas ajustaron conjuntamente el entorno de Kiro y los modelos de OpenAI, y el coste de que Terra completara una tarea con éxito se redujo aproximadamente un 82%.
Lo que se ahorra
es el dinero de los rodeos
En el ajuste de precios del 30 de julio, Terra bajó un 20%, pero en las pruebas de Kiro, el coste por tarea se redujo un 82%.
¿De dónde salió ese ahorro adicional del 60%?
Las direcciones son solo estas:
El modelo produce menos tokens, hay menos idas y venidas en las llamadas a herramientas, y hay menos reintentos y desvíos tras los fallos.
Por lo tanto, este gran bloque de ahorro no proviene del dinero de cada llamada, sino del dinero de aquellas llamadas que originalmente se habrían desperdiciado.
La lógica es simple: si un agente de IA falla en una tarea, la factura se sigue registrando. Si durante el proceso elige un camino equivocado, da tres vueltas por el camino incorrecto y luego vuelve, esos tokens también se cobran.
En el desarrollo real, el dinero a menudo se fuga así.
OpenAI también señaló la misma lógica en su blog oficial: la eficiencia proviene de tres capas:
El marco del agente que inicia las solicitudes y organiza el contexto, el sistema de orquestación que gestiona las solicitudes en el medio, y finalmente el modelo en sí que se ejecuta en las GPU.

OpenAI desglosa las fuentes de eficiencia de GPT-5.6: la solicitud parte del marco del agente, pasa por el sistema de orquestación y finalmente llega a la GPU para ejecutar el modelo, cada capa ahorra.
El ahorro de dinero también puede lograrse mediante la división del trabajo de los modelos.
OpenAI también mencionó un uso: el flujo de trabajo de codificación puede usar primero Sol para pensar claramente el problema y establecer el plan, luego cambiar a Luna para implementar los cambios ya definidos, escribir pruebas y ejecutar evaluaciones.
La misma línea de producción, con diferentes niveles de inteligencia asignados a diferentes etapas.
El modelo solo representa la mitad de la factura
Cambiar de marco significa cambiar de precio
El conjunto de pruebas de Terminal-Bench 2.1 no es una hoja de respuestas para el modelo solo.
Coloca el modelo en un entorno de terminal, le da un objetivo vago y le permite planificar su camino, ajustar herramientas, escribir scripts, manejar errores e iterar repetidamente por sí mismo.
Por lo tanto, el resultado obtenido es el resultado de la combinación "agente + modelo".

La lista pública de Terminal-Bench 2.1, a la derecha de la tasa de precisión hay un ítem adicional de coste. (Fuente: Terminal-Bench)
Las cuatro líneas de números en la lista son las más reveladoras:
Claude Code con Fable 5, 83.8%, 552.67 dólares;
Codex con GPT-5.5, 83.1%, 2059.19 dólares;
Codex con GPT-5.6 Terra, 78.4%, 421.15 dólares;
Codex con GPT-5.6 Luna, 75.7%, 241.45 dólares.
Las dos primeras líneas solo difieren en 0.7 puntos porcentuales en la puntuación, pero la factura difiere casi 4 veces.
El mismo modelo, integrado en diferentes marcos, con diferentes estrategias de organización de contexto y herramientas, resulta en precios completamente diferentes.
Según los datos oficiales proporcionados por Kiro, Terra obtuvo 77.4 puntos en el Índice de Agentes de Codificación, solo un poco más que los 77.2 de Claude Fable 5.
Su ventaja no está en la puntuación, sino en el precio correspondiente a esa puntuación.
El punto de enfoque spec-driven de Kiro también está aquí, el juego central es una simple frase: no se permite comenzar a escribir código de inmediato.
Primero desglosa el objetivo vago del usuario en un documento de requisitos formal, un diseño técnico y una lista de tareas ejecutables, y luego se lo entrega al modelo.
Así, lo que el modelo recibe ya no es una frase imprecisa, sino un trabajo claramente estructurado.
Quienes estén familiarizados con los Agentes reaccionarán de inmediato: este paso ahorra precisamente la parte más costosa del gasto.
Cuando un modelo se desvía, retrocede, vuelve a empezar, los tokens que consume a menudo superan a los utilizados en el trabajo real.
Kiro también deja dos barreras en el flujo: antes de que el código sea modificado realmente, se detiene para que una persona lo revise; después de que el trabajo se complete, se ejecuta automáticamente una ronda de pruebas para verificar si es correcto.
Cada reintento detenido por estas dos barreras puede ahorrar dinero real.
Claude en el territorio de Amazon
GPT se lleva la mitad
Hace un año, Kiro era solo un IDE spec-driven, y el selector de modelos era el territorio de Anthropic.
Un año después, AWS colocó de una vez tres modelos de OpenAI en su propia plataforma de agentes inteligentes de desarrollo.
Sol, Terra y Luna aparecen listados junto a Claude en el mismo menú desplegable, una imagen difícil de imaginar hace un año.
Aunque GPT-5.6 esta vez fue una "llegada familiar", no fue una "apertura total".
Los tres modelos se lanzaron de forma gradual y experimental, dirigidos a usuarios Pro, Pro+, Pro Max y Power, solo en dos regiones: Norte de Virginia (EE. UU.) y Fráncfort (Europa), con soporte para inferencia entre regiones.
Otra cosa que a muchos les resulta difícil de adaptar: estos modelos en Kiro operan con una cadena de pensamiento oculta; no puedes ver sus pasos de razonamiento, solo ves el resultado final.
Aquellos acostumbrados a observar paso a paso el razonamiento del Agente pueden sentir que es como arrojar el trabajo a una caja opaca.
La declaración oficial es que este es el comportamiento esperado y no afecta la calidad de la salida.
Los tres modelos tienen precios claros en Kiro.
Cuando se lanzaron el 14 de julio, para la misma tarea, Sol costaba 2.4 veces, Terra 1.2 veces y Luna 0.6 veces.
El 30 de julio, cuando la ronda de reducción de precios de OpenAI entró en vigor, Kiro la siguió al día siguiente: Luna se redujo de 0.6 veces a 0.1 veces, Terra de 1.2 veces a 1.0 veces, solo Sol permaneció sin cambios.

La actitud de AWS es clara: una plataforma de desarrollo no puede atarse a un solo modelo.
Dentro del mismo selector, dos modelos de vanguardia comienzan a presionarse mutuamente en los precios.
Los criterios de evaluación de los modelos también están cambiando: una puntuación alta ya no significa ganar por defecto, gastar menos también puede ganar.
Para los desarrolladores, antes la pregunta al elegir un modelo era "¿cuánto cuesta este modelo por millón de tokens?", ahora deben preguntar "¿cuánto me costará realmente que termine de hacer esto?".
Referencias:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
Este artículo proviene de la cuenta oficial de WeChat "新智元" (ID: AI_era), autor: ASI启示录, editor: 元宇






