
El modelo básico Luna ha bajado de precio de forma drástica: el precio por millón de tokens de entrada ha bajado de 1 dólar a 0,2 dólares, y el de salida, de 6 dólares a 1,2 dólares.
Convertido a renminbi, esto equivale a que el precio de entrada pasa de unos 6,8 yuanes a 1,35 yuanes, y el de salida, de unos 40,6 yuanes a 8,1 yuanes.
El modelo Terra, posicionado como "principal para el trabajo diario", también se ha abaratado un 20%, y los precios de entrada y salida han bajado a 2 dólares y 12 dólares, respectivamente.
Convertido a renminbi, son aproximadamente 13,5 y 81,2 yuanes, respectivamente.
Solo el modelo insignia, Sol, mantiene su precio original, pero ha lanzado el Modo rápido, que alcanza una velocidad hasta 2,5 veces superior a la del modo estándar, ofreciendo aceleración sin aumento de precio.

Después de que Codex restableciera agresivamente los usos, se ha organizado inmediatamente una bajada de precios, OpenAI... ¿a quién quieres agobiar?
La guerra de precios se ha vuelto directamente candente.
OpenAI ha afirmado que la bajada de precios se debe a que GPT-5.6 Sol se ha ayudado a sí mismo a ahorrar dinero.
GPT-5.6 Sol ha participado en su propia mejora, logrando un salto cualitativo en eficiencia, por lo que como regalo especial a usuarios nuevos y veteranos~
El truco de "pisarse el pie izquierdo con el derecho para elevarse", también lo has adoptado tú, OpenAI.

.
Dos modelos más baratos, uno más rápido
Actualmente, los precios de la API de los tres modelos de GPT-5.6 son:
GPT-5.6 Luna: 0,2 dólares por millón de tokens de entrada, 1,2 dólares por salida;
GPT-5.6 Terra: 2 dólares por millón de tokens de entrada, 12 dólares por salida;
GPT-5.6 Sol: 5 dólares por millón de tokens de entrada, 30 dólares por salida.

Tras la bajada de precios, Luna ha dado un auténtico salto al vacío.
Su precio de entrada ya es igual al de la generación anterior, GPT-5.4 nano, y su precio de salida es incluso 0,05 dólares más barato.
Pero las tareas de los dos modelos no son exactamente iguales: GPT-5.4 nano se centra principalmente en tareas sencillas y de alta frecuencia como clasificación, extracción de información y ordenación.
GPT-5.6 Luna, en cambio, está posicionado por OpenAI como un modelo orientado a cargas de trabajo sensibles a los costes, capaz de llamar a herramientas, manejar contextos largos y ejecutar flujos de trabajo de múltiples pasos.
En resumen, OpenAI está vendiendo el modelo que permite funcionar a los Agentes al precio de los antiguos modelos pequeños y sencillos.
Terra ha sido relativamente comedido, con una bajada del 20%.
Sol mantiene su precio original y añade el Modo rápido, que alcanza una velocidad hasta 2,5 veces superior a la del modo estándar, pero a un precio que es el doble, manteniendo el mismo nivel de inteligencia del modelo.
También sustituirá al anterior Procesamiento Prioritario. Las solicitudes API que usaban la etiqueta "priority" podrán cambiar automáticamente al Modo rápido.
Según la empresa, estos ajustes también se aplicarán a Codex y ChatGPT Work.
El precio de las suscripciones no bajará, ni aumentará la cantidad total de créditos de los usuarios, pero al llamar a Terra y Luna, el consumo de créditos se reducirá en consecuencia.
Con la misma cuota de suscripción, el modelo podrá hacer más tareas.
OpenAI también ha cambiado el modelo Auto-review en ChatGPT y Codex CLI de GPT-5.4 a GPT-5.6 Luna.
Auto-review se encarga de comprobar en segundo plano el código y los resultados de las modificaciones, una típica tarea de Agente de alta frecuencia.
Combinando la actualización del modelo y la bajada de precios de Luna, OpenAI estima que sus costes se reducirán a aproximadamente una décima parte de los anteriores.
Los modelos baratos ya no se encargan solo de los tradicionales "trabajos menores" como clasificación y extracción, sino que empiezan a entrar en eslabones que requieren juicio y llamadas a herramientas, como la revisión de código y la supervisión en segundo plano.
Actualmente, el posicionamiento de los tres modelos es:
Las tareas sensibles al presupuesto y de gran volumen de llamadas se asignan a Luna;
El trabajo diario normal se asigna a Terra;
Las tareas de alta dificultad siguen utilizando Sol;
Y si incluso la espera resulta demasiado lenta, se puede gastar el doble de dinero para adquirir velocidad.
GPT-5.6 empieza a participar en la reducción de sus propios costes
¿Por qué esta bajada de precios repentina?
OpenAI afirma que la razón es que GPT-5.6 Sol ha participado en la optimización de su propio sistema de producción.
Las mejoras de eficiencia que ha logrado se han convertido en números con descuento en la lista de precios.
En concreto, GPT-5.6 Sol ha reescrito y optimizado parte del núcleo (Kernel) GPU del entorno de producción, ha diseñado y ejecutado cientos de experimentos de generación de tokens, y ha participado en la supervisión del entrenamiento, interviniendo cuando surgían problemas.
Los resultados también son destacables: la optimización del núcleo GPU de producción ha reducido el coste del servicio integral de GPT-5.6 en un 20%; las mejoras en la decodificación especulativa han aumentado la eficiencia de generación de tokens en más de un 15%.

El núcleo (Kernel) GPU puede entenderse como el programa de bajo nivel que ejecuta las tareas de cálculo específicas del modelo en la GPU.
El modelo en sí no necesita cambiar; simplemente, si estos programas se escriben de manera más eficiente, la misma GPU podrá completar los cálculos más rápido, procesar más solicitudes y el coste por llamada también disminuirá.
La decodificación especulativa, por su parte, consiste en "adivinar" primero por lotes los tokens que podrían aparecer a continuación al generar una respuesta, y luego entregárselos al modelo principal para su verificación. Cuanto más precisa sea la suposición, menos pasos habrá que generar y esperar uno por uno.
Ambas optimizaciones no reducen la capacidad del modelo, pero permiten que el mismo modelo funcione más rápido y más barato.
Sin embargo, esto todavía no significa que GPT-5.6 se actualice por completo de forma autónoma.
OpenAI enfatiza específicamente que todo el proceso sigue estando dirigido por humanos.
El modelo puede escribir código, ejecutar experimentos y supervisar anomalías, pero cómo se definen los objetivos, si se pueden utilizar los resultados y si el código entra en el entorno de producción, sigue requiriendo "Human in the Loop" (Humano en el bucle).
Por último
Finalmente, hay un nuevo cambio.
Esta bajada de precios tiene un objetivo muy concreto: los flujos de trabajo de Agentes.
Luna, el modelo con mayor descuento, no es solo un modelo pequeño tradicional para hacer clasificaciones y extracciones.
Según el posicionamiento de OpenAI, puede llamar a herramientas y ejecutar tareas de múltiples pasos, orientándose principalmente a cargas de trabajo de alta frecuencia y sensibles a los costes.
Por lo tanto, la reducción del 80% en el precio de Luna también está rebajando el umbral para la ejecución prolongada de Agentes.
Hace posible que tareas como la revisión, verificación y supervisión, que antes no se podían ejecutar con frecuencia debido a su alto coste, se conviertan en pasos rutinarios dentro de los flujos de trabajo.
Combinado con la participación de GPT-5.6 en la optimización de su propio sistema de producción, aparece un nuevo ciclo:
El modelo participa en mejorar la eficiencia operativa, reduciendo los costes; al bajar los precios, el modelo entra en más flujos de trabajo de alta frecuencia; el aumento en la escala de llamadas impulsa, a su vez, la siguiente ronda de optimizaciones de eficiencia.
Esta rueda volante de bajada de precios de OpenAI ya empieza a tomar forma.
Con esta serie de movimientos, ahora la presión recae directamente en la Empresa A:
"Te toca a ti."

Enlaces de referencia:[1]https://x.com/OpenAI/status/2082878156483219672[2]https://x.com/sama/status/2082880720989532597
Este artículo procede del canal público de WeChat "量子位" (Quantum Bit), autor: Atención a la tecnología de vanguardia.







