GPT-5.6 Sol de repente se vuelve más tonto, ¿el presupuesto de razonamiento se reduce de 960 a 128? ¿Ya no hay un modelo de inteligencia fija?

marsbitPublished on 2026-07-15Last updated on 2026-07-15

Abstract

El equipo japonés que usaba Codex Sol MAX para tareas complejas notó un repentino descenso en su rendimiento: de una calidad "12 o 13" cayó a un "8", perdiendo profundidad en el razonamiento. La queja se repitió en la comunidad: el modelo responde más rápido, pero parece menos reflexivo. Los usuarios investigaron y descubrieron un parámetro interno no documentado: el "juice value". Este valor, que refleja el presupuesto de cómputo para razonamiento, habría bajado de 960 a 128 para el modo Max, una reducción del ~87%. Simultáneamente, el contexto útil se redujo de ~372k a ~272k tokens. Tibo (Thibault Sottiaux) de OpenAI respondió que no hubo "nerf" (reducción de inteligencia). Explicó que estaban optimizando la eficiencia del razonamiento para liberar capacidad (~10% más de uso para suscriptores). También citó un experimento para analizar un uso mayor al esperado, en el que ajustaron temporalmente el "juice value" (esfuerzo de razonamiento), pero ya lo revirtieron. Asimismo, mencionó que están ajustando el uso de multi-agentes y auto-revisiones. El incidente destaca la tensión entre la eficiencia operativa de la plataforma y la experiencia del usuario. Para los usuarios, un "juice value" más bajo se traduce en que el modelo "piensa menos". El debate expone cómo el rendimiento percibido de un modelo puede variar mediante parámetros de configuración internos que controla el proveedor, llevando a algunos a comparar el servicio con una "bombilla cuya intensidad controla la plata...

En toda la web se dice que el nivel Max de GPT-5.6 Sol se ha vuelto más tonto, pero OpenAI insiste en que no ha habido una "rebaja de inteligencia", sino que fue "un experimento". Durante el experimento, ajustaron un regulador interno, bajando el nivel Max de 960 a 128, un cambio invisible para el usuario.

¡GPT-5.6 Sol se volvió más tonto de la noche a la mañana!

Un equipo de investigación de mercado japonés, poco después de comenzar su jornada laboral por la mañana, notó que su Codex Sol MAX no funcionaba como de costumbre. El líder del equipo escribió un extenso post sobre su experiencia de toda la mañana y lo publicó en el subreddit r/codex.

Eran las 9 de la mañana y el equipo comenzaba como siempre. Para las 10:40, cada uno de sus miembros había notado lo mismo.

Conectaban Codex Sol MAX a una herramienta CLI propia, especializada en trabajos que requerían cálculos extremadamente complejos y razonamiento profundo.

Al principio, Codex Sol MAX cumplía con creces las expectativas. Si el nivel de exigencia era 10, entregaba constantemente un 12 o un 13. Era un "monstruo que superaba todas las expectativas", "todo el mundo estaba encantado con él".

Pero esa mañana, el rendimiento de este "monstruo" se desplomó, cayendo a un 8.

La profundidad del razonamiento había disminuido notablemente.

Antes, Codex Sol MAX dedicaba más de diez minutos a un solo prompt, probando, razonando y utilizando sus herramientas repetidamente hasta que el trabajo quedaba impecable.

Pero esa capacidad "desapareció por completo" esa mañana.

Toda la web piensa que se ha "vuelto más tonto"

La experiencia del equipo japonés es solo un ejemplo de lo que se vive estos días en la comunidad de Codex.

Las quejas son muy consistentes: el modelo es efectivamente más rápido, responde con más agilidad, pero se niega a profundizar. Se ha perdido esa capacidad de investigar primero, luego actuar, y refutar sus propias ideas sobre la marcha.

Una frase de un usuario de X resume la sensación general:

A todos se les bajó un nivel el ajuste de razonamiento colectivamente: si antes usabas Extra High, ahora tienes que ponerlo en Max para recuperar un poco de esa capacidad anterior.

Este cambio es algo que el usuario promedio no puede demostrar.

No puedes ver si han cambiado los pesos del modelo, ni cuánto poder de cómputo te asigna el servidor.

Lo único que puedes percibir son cuatro cosas: qué tan rápido responde, cuánto tiempo piensa, si revisa lo que ha hecho, y si llama a otros agentes inteligentes para colaborar.

Todas estas son señales indirectas; ninguna está escrita en la ficha técnica del modelo.

Así que, algunos usuarios de la comunidad investigaron por su cuenta y descubrieron un parámetro interno que OpenAI nunca ha hecho público: el "juice value".

Un número que la compañía nunca ha mencionado

Lo único que OpenAI ha explicado públicamente son los niveles de razonamiento.

El 9 de julio, con el lanzamiento de GPT-5.6, la declaración oficial fue que se introducía por primera vez la máxima intensidad de razonamiento (max), "permitiendo a Sol disponer del tiempo más amplio para razonar en profundidad". Por encima estaba ultra, que activaba por defecto cuatro agentes inteligentes trabajando en paralelo.

En ChatGPT, esto se traduce en las opciones del selector de modelo: Medium, High, Extra High, todas ejecutando Sol en el backend. El nivel Pro ejecuta Sol Pro.

Pero el "juice value" es lo que hay debajo de estos niveles: el presupuesto interno de recursos de cómputo para el razonamiento. Los usuarios no lo ven, y OpenAI nunca ha revelado su valor.

El usuario de la comunidad ns123abc utilizó un prompt oculto, conocido como la "huella digital del modelo", para leer en la configuración del sistema ese valor: juice.

Previamente, la comunidad había observado que el nivel max de Sol correspondía a 960. Esta vez, la pantalla mostraba 128, una caída de casi el 87%.

Casi al mismo tiempo, comenzaron a circular otras capturas de pantalla: el contexto real utilizable por los usuarios en el cliente de Codex había retrocedido de unos 372k a 272k.

Estos dos números rápidamente encendieron a toda la comunidad.

Tibo: No hay "rebaja de inteligencia", estamos investigando el uso

Esa misma noche, Tibo (Thibault Sottiaux) se pronunció. Él es responsable de Codex y ChatGPT Work en OpenAI.

Tibo publicó una actualización en X, comenzando con la frase: No hubo nerf (debilitamiento), solo cosas buenas.

Luego, enfatizó cuatro puntos de una vez.

Primero, las optimizaciones de eficiencia en el razonamiento ya están implementadas. Los recursos computacionales ahorrados se reinvierten en todos los usuarios suscritos, lo que por sí solo puede aumentar aproximadamente un 10% el uso disponible.

Segundo, el límite de contexto de Sol se incrementó de 272k (de GPT-5.5) a 372k, lo que resultó en facturaciones más altas de lo esperado. Ya se ha revertido a 272k, y se restaurará 372k en los próximos días.

Tercero, para entender de dónde venía ese uso adicional, el equipo realizó algunos experimentos. En esos experimentos, ajustaron la intensidad del razonamiento (reasoning effort), a la que internamente llaman "juice values".

Eso ya ha sido revertido.

Cuarto, el uso de múltiples agentes en los niveles high y xhigh fue mayor de lo previsto, y también hubo desperdicio en el auto-review. Todo eso se está corrigiendo.

El mensaje de Tibo, en esencia, era: no fue "debilitar la inteligencia", fue "ajustar parámetros".

No mencionó si se tocaron los pesos del modelo. Pero admitió que se habían modificado las configuraciones que realmente llegan al usuario.

¿Qué es exactamente "juice"? Según la información pública disponible, parece más una marca interna de asignación de recursos para el razonamiento. En términos generales, es cuántos recursos de razonamiento permite el sistema que el modelo invierta en una tarea.

Aunque reducir el presupuesto no es igual a "debilitar el modelo", puede cambiar silenciosamente muchas cosas:

Cuántos caminos puede explorar en una tarea de larga duración, cuántas rondas de comparación entre múltiples soluciones, si ejecuta pruebas activamente después de generar código, cuántas veces está dispuesto a retroceder tras un fallo, y esa pequeña parte de "habilidades de cola larga" que son decisivas en tareas extremadamente difíciles.

En definitiva, representa cuánto esfuerzo está dispuesto a poner el modelo en una tarea.

Para poner fin a este debate, se necesita un experimento controlado estricto: la misma instantánea del modelo, el mismo conjunto de tareas, el mismo entorno de herramientas, variando solo la variable "juice".

Para ver cuánto caen realmente la codificación compleja, los agentes de larga duración, el razonamiento matemático y la recuperación de errores.

Esa evidencia, hasta ahora, sigue ausente.

Cada token que ahorra el proveedor, el usuario lo nota

Volvamos al experimento que menciona Tibo. ¿Cómo surgió?

Tras el lanzamiento de GPT-5.6, la demanda se disparó inmediatamente.

OpenAI incluso levantó temporalmente la restricción de uso de la ventana de cinco horas para manejar la avalancha de llamadas.

Y las características más llamativas de GPT-5.6 – el pensamiento más prolongado en el nivel max, cuatro agentes en paralelo por defecto en ultra, la ventana de contexto más grande – son precisamente monstruos devoradores de tokens.

El uso adicional provino exactamente de ahí.

Así que se realizó este experimento. Para investigar los costes, primero bajaron la variable del presupuesto para ver hacia dónde se dirigía el uso. Desde la ingeniería, esto tiene sentido.

Pero el problema está precisamente ahí: cuando el proveedor ahorra tokens, el usuario lo percibe. Lo más evidente es que el modelo "se niega a pensar".

La variable que ajustaron resulta ser justo la que el usuario puede sentir.

La IA ya no "hace milagros", empieza a fichar

En los últimos años, las empresas de modelos grandes han cultivado una imaginación casi religiosa.

La gente también trataba a los modelos como oráculos, esperando que en algún momento de la noche arrojaran una respuesta que los humanos no habían pensado. Estaban dispuestos a tolerar que fuera un poco más lento, un poco más caro, o que ocasionalmente alucinara.

Pero los milagros de laboratorio pueden permitirse ignorar los costes. Sin embargo, cuando se trata de infraestructuras industriales en producción, eso ya no es posible.

Así, modelos de vanguardia como Sol están pasando de ser profetas que ocasionalmente "hacen milagros" en un laboratorio, a convertirse en motores que funcionan sin parar en los flujos de trabajo diarios.

Detrás de esto hay más bien un proceso de domesticación de la inteligencia, y esta controversia ha revelado públicamente el proceso. Al mismo tiempo, la ilusión de los usuarios sobre una "inteligencia fija" está llegando a su fin.

Suscribirse a un modelo es más como comprar una bombilla: el modelo es fijo, pero el regulador de intensidad siempre ha estado en manos de la plataforma.

Esto puede ser una decisión comercial correcta, pero no debería permanecer siempre oculto en una caja negra.

Si la IA realmente quiere convertirse en la infraestructura básica de las empresas, los proveedores deben ofrecer límites más específicos que el nombre del modelo, para que los usuarios entiendan exactamente qué garantiza el Max por el que pagan.

De lo contrario, es solo una etiqueta de precio.

Referencias:

https://x.com/thsottiaux/status/2076495156757577895

https://x.com/FixlationAI/status/2076469274441380349

https://www.reddit.com/r/codex/comments/1uuy5eq/nerfed_codex_sol_max/

Este artículo proviene del WeChat público "New Zhiyuan" (新智元), autor: Yuanyu (元宇).

Trending Cryptos

Related Questions

Q¿Qué observó el equipo de investigación de mercado japonés sobre el rendimiento de Codex Sol MAX?

AEl equipo observó que Codex Sol MAX, que normalmente entregaba un rendimiento sobresaliente, de repente mostró una disminución significativa en la profundidad del razonamiento. Antes solía tomar más de diez minutos para analizar, probar y refinar soluciones, pero esa capacidad pareció desaparecer, resultando en un trabajo menos detallado y profundo.

Q¿Qué es el 'juice value' mencionado en el artículo y qué cambio se observó?

AEl 'juice value' es un parámetro interno no documentado de OpenAI que representa el presupuesto de recursos computacionales asignados para el razonamiento. La comunidad observó que para el modo 'max' de Sol, este valor bajó de 960 a 128, lo que supone una reducción de aproximadamente el 87%.

Q¿Cómo respondió Tibo (Thibault Sottiaux) de OpenAI a las quejas sobre la supuesta 'reducción de inteligencia' de GPT-5.6 Sol?

ATibo negó que hubiera una 'nerf' o reducción de inteligencia. Explicó que los cambios se debieron a experimentos para entender el uso de recursos tras el lanzamiento de GPT-5.6, a una optimización de eficiencia que liberaría capacidad para los usuarios, y a ajustes temporales en la ventana de contexto y la configuración del 'juice value' (esfuerzo de razonamiento), los cuales ya se habían revertido.

Q¿Qué impacto tuvo la popularidad de GPT-5.6 en el consumo de recursos según el artículo?

AEl lanzamiento de GPT-5.6 provocó una gran demanda, lo que obligó a OpenAI a levantar temporalmente los límites de uso. Las nuevas funciones, como el razonamiento más prolongado en el modo 'max', el uso de múltiples agentes en 'ultra' y la ventana de contexto más grande, consumen muchos tokens, lo que generó un aumento en el uso de recursos que la empresa intentaba analizar con sus experimentos.

QSegún el análisis final del artículo, ¿qué cambia en la relación entre los usuarios y los modelos de IA como Sol tras este incidente?

AEl incidente revela que la 'inteligencia' entregada por estos modelos no es fija. Los usuarios pasan de ver el modelo como un oráculo fiable a entender que es un recurso configurable, donde parámetros como el presupuesto de razonamiento ('juice') pueden ser ajustados por la plataforma. Esto rompe la ilusión de un 'modelo fijo' y exige a los proveedores mayor transparencia sobre lo que garantizan los niveles de servicio por los que los usuarios pagan.

Related Reads

A 'Difficult Midsummer' for Stock Market Bulls: $100 Oil, AI Backlash, and Tariff Resumption

Global equities face a triple threat this summer: surging oil prices, a burgeoning AI capex crisis, and resurgent tariffs, pressuring the core pillars of the current bull market. Brent crude topped $100/barrel amid Middle East and Red Sea supply disruptions, while proposed U.S. tariffs fueled inflation fears, pushing the 10-year Treasury yield to 4.66%. Simultaneously, the tech rally faltered as Alphabet's steep AI capex hike sparked concerns over returns, dragging down mega-caps and contributing to a weekly S&P 500 decline. The "Goldilocks" narrative of resilient profits, controlled inflation, and endless AI expansion is cracking. Rising oil prices threaten to reignite persistent inflation, forcing a repricing of interest rate risks. In tech, massive debt-fueled AI investments are facing investor scrutiny as higher rates raise the required return threshold. Fears are growing that the AI spending boom may be unsustainable, especially with moves toward cheaper, open-source models. Next week brings a crucial test with key central bank meetings and earnings from major tech firms like Microsoft and Apple. Technical indicators are deteriorating, with selling pressure mounting and assets like gold and the dollar gaining on避险 sentiment. Analysts warn that elevated valuations and compressed risk premiums leave markets vulnerable, with significant potential downside if the current headwinds persist.

链捕手5m ago

A 'Difficult Midsummer' for Stock Market Bulls: $100 Oil, AI Backlash, and Tariff Resumption

链捕手5m ago

Three 'Reflexivity' Shadows Hang Over the Market

Global markets are currently enveloped by three mutually reinforcing "reflexive" loops: oil price politics, outsized capital expenditure by hyperscale cloud providers, and AI debt risks. According to Goldman Sachs, the combined negative feedback from these factors places the market in a fragile and precarious state. The first loop involves the two-way feedback between surging oil prices and rising interest rates. Brent crude's brief breach of $100 per barrel tests expectations of a U.S. policy response to curb prices and inflation. However, the delay in such intervention forces markets to increasingly price in the risks themselves. Higher energy costs are already impacting corporate earnings, as seen with an airline's profit warning, and threaten to fuel broader inflation. The second loop concerns the massive, escalating capital expenditure (capex) by major tech firms like Google, which recently raised its 2026 capex forecast significantly. The market's tolerance for viewing such spending as a cost-free growth signal is waning, shifting focus to investment returns. This competitive capex spiral pressures the entire cloud and semiconductor sector. Furthermore, the competitive gap in AI between leading closed-source and Chinese open-source models is narrowing rapidly, threatening the economic rationale behind massive investments. The third reflexive danger lies in the financing structures supporting this expansion. Bond prices for entities funding AI infrastructure, such as a Meta financing vehicle, have fallen sharply from issue price. While hyperscale balance sheets remain strong, soaring capex is eroding free cash flow conversion. There is a growing risk that today's capacity build-out leads to future oversupply and significant depreciation charges. Key near-term tests for these dynamics include Microsoft's upcoming earnings, which will scrutinize its balance of growth, spending, and cash flow, and the IPO of Chinese memory chipmaker CXMT, a major new competitor. The current environment is characterized by reflexivity, where each variable is both a cause and an effect, creating a self-reinforcing cycle of uncertainty.

链捕手11m ago

Three 'Reflexivity' Shadows Hang Over the Market

链捕手11m ago

Claude Doesn't Submit Code Directly After Writing It: Runs 4 Skills for Self-Check, Fixes Issues, Then Comes Back to You

Claude No Longer Submits Code Directly: 4 Self-Check Skills to Run Before Coming Back to You AI already writes code, but the burden of reviewing it still falls on you. To address this, Anthropic has built a "verification loop" into Claude Code. After writing code, Claude now runs four self-check skills before delivering the work: * `/code-review`: Finds potential bugs and provides review feedback. * `/simplify`: Cleans up the diff, removing redundant or over-complex implementations to reduce future maintenance costs. * `/verify`: Performs end-to-end validation, actually running the application to confirm the feature works, not just appears to. * `/design`: Used only for UI changes; cross-references the implementation against the project's DESIGN.md file. This loop extends the AI agent's workflow from "gather context → execute" to "gather context → execute → auto-verify → fix → re-verify." It tackles the new bottleneck in AI-assisted development: the speed of verifying code now outpaces human review. These skills are built on Claude Code's existing verification foundation (like running apps and using linters). Teams can create their own custom verification skills by documenting their repetitive manual checks in plain language as Markdown files. Verification can be triggered at four levels: manually (Standalone), embedded in a task, chained with other skills, or automatically on every PR (On every PR). The shift signifies that competition in AI programming is moving from code generation to robust verification and self-correction. Well-built verification loops allow AI agents to run longer and more autonomously with less human supervision. Skills, which encapsulate team knowledge and workflows, are becoming a cross-vendor standard, meaning a team's efficiency gap will depend less on the AI model and more on their investment in these automated workflows and verification mechanisms.

marsbit17m ago

Claude Doesn't Submit Code Directly After Writing It: Runs 4 Skills for Self-Check, Fixes Issues, Then Comes Back to You

marsbit17m ago

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of SOL (SOL) are presented below.

活动图片