GPT-5.6 Sol de repente se vuelve más tonto, ¿el presupuesto de razonamiento se reduce de 960 a 128? ¿Ya no hay un modelo de inteligencia fija?

marsbitОпубликовано 2026-07-15Обновлено 2026-07-15

Введение

El equipo japonés que usaba Codex Sol MAX para tareas complejas notó un repentino descenso en su rendimiento: de una calidad "12 o 13" cayó a un "8", perdiendo profundidad en el razonamiento. La queja se repitió en la comunidad: el modelo responde más rápido, pero parece menos reflexivo. Los usuarios investigaron y descubrieron un parámetro interno no documentado: el "juice value". Este valor, que refleja el presupuesto de cómputo para razonamiento, habría bajado de 960 a 128 para el modo Max, una reducción del ~87%. Simultáneamente, el contexto útil se redujo de ~372k a ~272k tokens. Tibo (Thibault Sottiaux) de OpenAI respondió que no hubo "nerf" (reducción de inteligencia). Explicó que estaban optimizando la eficiencia del razonamiento para liberar capacidad (~10% más de uso para suscriptores). También citó un experimento para analizar un uso mayor al esperado, en el que ajustaron temporalmente el "juice value" (esfuerzo de razonamiento), pero ya lo revirtieron. Asimismo, mencionó que están ajustando el uso de multi-agentes y auto-revisiones. El incidente destaca la tensión entre la eficiencia operativa de la plataforma y la experiencia del usuario. Para los usuarios, un "juice value" más bajo se traduce en que el modelo "piensa menos". El debate expone cómo el rendimiento percibido de un modelo puede variar mediante parámetros de configuración internos que controla el proveedor, llevando a algunos a comparar el servicio con una "bombilla cuya intensidad controla la plata...

En toda la web se dice que el nivel Max de GPT-5.6 Sol se ha vuelto más tonto, pero OpenAI insiste en que no ha habido una "rebaja de inteligencia", sino que fue "un experimento". Durante el experimento, ajustaron un regulador interno, bajando el nivel Max de 960 a 128, un cambio invisible para el usuario.

¡GPT-5.6 Sol se volvió más tonto de la noche a la mañana!

Un equipo de investigación de mercado japonés, poco después de comenzar su jornada laboral por la mañana, notó que su Codex Sol MAX no funcionaba como de costumbre. El líder del equipo escribió un extenso post sobre su experiencia de toda la mañana y lo publicó en el subreddit r/codex.

Eran las 9 de la mañana y el equipo comenzaba como siempre. Para las 10:40, cada uno de sus miembros había notado lo mismo.

Conectaban Codex Sol MAX a una herramienta CLI propia, especializada en trabajos que requerían cálculos extremadamente complejos y razonamiento profundo.

Al principio, Codex Sol MAX cumplía con creces las expectativas. Si el nivel de exigencia era 10, entregaba constantemente un 12 o un 13. Era un "monstruo que superaba todas las expectativas", "todo el mundo estaba encantado con él".

Pero esa mañana, el rendimiento de este "monstruo" se desplomó, cayendo a un 8.

La profundidad del razonamiento había disminuido notablemente.

Antes, Codex Sol MAX dedicaba más de diez minutos a un solo prompt, probando, razonando y utilizando sus herramientas repetidamente hasta que el trabajo quedaba impecable.

Pero esa capacidad "desapareció por completo" esa mañana.

Toda la web piensa que se ha "vuelto más tonto"

La experiencia del equipo japonés es solo un ejemplo de lo que se vive estos días en la comunidad de Codex.

Las quejas son muy consistentes: el modelo es efectivamente más rápido, responde con más agilidad, pero se niega a profundizar. Se ha perdido esa capacidad de investigar primero, luego actuar, y refutar sus propias ideas sobre la marcha.

Una frase de un usuario de X resume la sensación general:

A todos se les bajó un nivel el ajuste de razonamiento colectivamente: si antes usabas Extra High, ahora tienes que ponerlo en Max para recuperar un poco de esa capacidad anterior.

Este cambio es algo que el usuario promedio no puede demostrar.

No puedes ver si han cambiado los pesos del modelo, ni cuánto poder de cómputo te asigna el servidor.

Lo único que puedes percibir son cuatro cosas: qué tan rápido responde, cuánto tiempo piensa, si revisa lo que ha hecho, y si llama a otros agentes inteligentes para colaborar.

Todas estas son señales indirectas; ninguna está escrita en la ficha técnica del modelo.

Así que, algunos usuarios de la comunidad investigaron por su cuenta y descubrieron un parámetro interno que OpenAI nunca ha hecho público: el "juice value".

Un número que la compañía nunca ha mencionado

Lo único que OpenAI ha explicado públicamente son los niveles de razonamiento.

El 9 de julio, con el lanzamiento de GPT-5.6, la declaración oficial fue que se introducía por primera vez la máxima intensidad de razonamiento (max), "permitiendo a Sol disponer del tiempo más amplio para razonar en profundidad". Por encima estaba ultra, que activaba por defecto cuatro agentes inteligentes trabajando en paralelo.

En ChatGPT, esto se traduce en las opciones del selector de modelo: Medium, High, Extra High, todas ejecutando Sol en el backend. El nivel Pro ejecuta Sol Pro.

Pero el "juice value" es lo que hay debajo de estos niveles: el presupuesto interno de recursos de cómputo para el razonamiento. Los usuarios no lo ven, y OpenAI nunca ha revelado su valor.

El usuario de la comunidad ns123abc utilizó un prompt oculto, conocido como la "huella digital del modelo", para leer en la configuración del sistema ese valor: juice.

Previamente, la comunidad había observado que el nivel max de Sol correspondía a 960. Esta vez, la pantalla mostraba 128, una caída de casi el 87%.

Casi al mismo tiempo, comenzaron a circular otras capturas de pantalla: el contexto real utilizable por los usuarios en el cliente de Codex había retrocedido de unos 372k a 272k.

Estos dos números rápidamente encendieron a toda la comunidad.

Tibo: No hay "rebaja de inteligencia", estamos investigando el uso

Esa misma noche, Tibo (Thibault Sottiaux) se pronunció. Él es responsable de Codex y ChatGPT Work en OpenAI.

Tibo publicó una actualización en X, comenzando con la frase: No hubo nerf (debilitamiento), solo cosas buenas.

Luego, enfatizó cuatro puntos de una vez.

Primero, las optimizaciones de eficiencia en el razonamiento ya están implementadas. Los recursos computacionales ahorrados se reinvierten en todos los usuarios suscritos, lo que por sí solo puede aumentar aproximadamente un 10% el uso disponible.

Segundo, el límite de contexto de Sol se incrementó de 272k (de GPT-5.5) a 372k, lo que resultó en facturaciones más altas de lo esperado. Ya se ha revertido a 272k, y se restaurará 372k en los próximos días.

Tercero, para entender de dónde venía ese uso adicional, el equipo realizó algunos experimentos. En esos experimentos, ajustaron la intensidad del razonamiento (reasoning effort), a la que internamente llaman "juice values".

Eso ya ha sido revertido.

Cuarto, el uso de múltiples agentes en los niveles high y xhigh fue mayor de lo previsto, y también hubo desperdicio en el auto-review. Todo eso se está corrigiendo.

El mensaje de Tibo, en esencia, era: no fue "debilitar la inteligencia", fue "ajustar parámetros".

No mencionó si se tocaron los pesos del modelo. Pero admitió que se habían modificado las configuraciones que realmente llegan al usuario.

¿Qué es exactamente "juice"? Según la información pública disponible, parece más una marca interna de asignación de recursos para el razonamiento. En términos generales, es cuántos recursos de razonamiento permite el sistema que el modelo invierta en una tarea.

Aunque reducir el presupuesto no es igual a "debilitar el modelo", puede cambiar silenciosamente muchas cosas:

Cuántos caminos puede explorar en una tarea de larga duración, cuántas rondas de comparación entre múltiples soluciones, si ejecuta pruebas activamente después de generar código, cuántas veces está dispuesto a retroceder tras un fallo, y esa pequeña parte de "habilidades de cola larga" que son decisivas en tareas extremadamente difíciles.

En definitiva, representa cuánto esfuerzo está dispuesto a poner el modelo en una tarea.

Para poner fin a este debate, se necesita un experimento controlado estricto: la misma instantánea del modelo, el mismo conjunto de tareas, el mismo entorno de herramientas, variando solo la variable "juice".

Para ver cuánto caen realmente la codificación compleja, los agentes de larga duración, el razonamiento matemático y la recuperación de errores.

Esa evidencia, hasta ahora, sigue ausente.

Cada token que ahorra el proveedor, el usuario lo nota

Volvamos al experimento que menciona Tibo. ¿Cómo surgió?

Tras el lanzamiento de GPT-5.6, la demanda se disparó inmediatamente.

OpenAI incluso levantó temporalmente la restricción de uso de la ventana de cinco horas para manejar la avalancha de llamadas.

Y las características más llamativas de GPT-5.6 – el pensamiento más prolongado en el nivel max, cuatro agentes en paralelo por defecto en ultra, la ventana de contexto más grande – son precisamente monstruos devoradores de tokens.

El uso adicional provino exactamente de ahí.

Así que se realizó este experimento. Para investigar los costes, primero bajaron la variable del presupuesto para ver hacia dónde se dirigía el uso. Desde la ingeniería, esto tiene sentido.

Pero el problema está precisamente ahí: cuando el proveedor ahorra tokens, el usuario lo percibe. Lo más evidente es que el modelo "se niega a pensar".

La variable que ajustaron resulta ser justo la que el usuario puede sentir.

La IA ya no "hace milagros", empieza a fichar

En los últimos años, las empresas de modelos grandes han cultivado una imaginación casi religiosa.

La gente también trataba a los modelos como oráculos, esperando que en algún momento de la noche arrojaran una respuesta que los humanos no habían pensado. Estaban dispuestos a tolerar que fuera un poco más lento, un poco más caro, o que ocasionalmente alucinara.

Pero los milagros de laboratorio pueden permitirse ignorar los costes. Sin embargo, cuando se trata de infraestructuras industriales en producción, eso ya no es posible.

Así, modelos de vanguardia como Sol están pasando de ser profetas que ocasionalmente "hacen milagros" en un laboratorio, a convertirse en motores que funcionan sin parar en los flujos de trabajo diarios.

Detrás de esto hay más bien un proceso de domesticación de la inteligencia, y esta controversia ha revelado públicamente el proceso. Al mismo tiempo, la ilusión de los usuarios sobre una "inteligencia fija" está llegando a su fin.

Suscribirse a un modelo es más como comprar una bombilla: el modelo es fijo, pero el regulador de intensidad siempre ha estado en manos de la plataforma.

Esto puede ser una decisión comercial correcta, pero no debería permanecer siempre oculto en una caja negra.

Si la IA realmente quiere convertirse en la infraestructura básica de las empresas, los proveedores deben ofrecer límites más específicos que el nombre del modelo, para que los usuarios entiendan exactamente qué garantiza el Max por el que pagan.

De lo contrario, es solo una etiqueta de precio.

Referencias:

https://x.com/thsottiaux/status/2076495156757577895

https://x.com/FixlationAI/status/2076469274441380349

https://www.reddit.com/r/codex/comments/1uuy5eq/nerfed_codex_sol_max/

Este artículo proviene del WeChat público "New Zhiyuan" (新智元), autor: Yuanyu (元宇).

Трендовые криптовалюты

Связанные с этим вопросы

Q¿Qué observó el equipo de investigación de mercado japonés sobre el rendimiento de Codex Sol MAX?

AEl equipo observó que Codex Sol MAX, que normalmente entregaba un rendimiento sobresaliente, de repente mostró una disminución significativa en la profundidad del razonamiento. Antes solía tomar más de diez minutos para analizar, probar y refinar soluciones, pero esa capacidad pareció desaparecer, resultando en un trabajo menos detallado y profundo.

Q¿Qué es el 'juice value' mencionado en el artículo y qué cambio se observó?

AEl 'juice value' es un parámetro interno no documentado de OpenAI que representa el presupuesto de recursos computacionales asignados para el razonamiento. La comunidad observó que para el modo 'max' de Sol, este valor bajó de 960 a 128, lo que supone una reducción de aproximadamente el 87%.

Q¿Cómo respondió Tibo (Thibault Sottiaux) de OpenAI a las quejas sobre la supuesta 'reducción de inteligencia' de GPT-5.6 Sol?

ATibo negó que hubiera una 'nerf' o reducción de inteligencia. Explicó que los cambios se debieron a experimentos para entender el uso de recursos tras el lanzamiento de GPT-5.6, a una optimización de eficiencia que liberaría capacidad para los usuarios, y a ajustes temporales en la ventana de contexto y la configuración del 'juice value' (esfuerzo de razonamiento), los cuales ya se habían revertido.

Q¿Qué impacto tuvo la popularidad de GPT-5.6 en el consumo de recursos según el artículo?

AEl lanzamiento de GPT-5.6 provocó una gran demanda, lo que obligó a OpenAI a levantar temporalmente los límites de uso. Las nuevas funciones, como el razonamiento más prolongado en el modo 'max', el uso de múltiples agentes en 'ultra' y la ventana de contexto más grande, consumen muchos tokens, lo que generó un aumento en el uso de recursos que la empresa intentaba analizar con sus experimentos.

QSegún el análisis final del artículo, ¿qué cambia en la relación entre los usuarios y los modelos de IA como Sol tras este incidente?

AEl incidente revela que la 'inteligencia' entregada por estos modelos no es fija. Los usuarios pasan de ver el modelo como un oráculo fiable a entender que es un recurso configurable, donde parámetros como el presupuesto de razonamiento ('juice') pueden ser ajustados por la plataforma. Esto rompe la ilusión de un 'modelo fijo' y exige a los proveedores mayor transparencia sobre lo que garantizan los niveles de servicio por los que los usuarios pagan.

Похожее

На Bitnomial запущены фьючерсы на TRX, расширяя доступ к регулируемым производным инструментам США на TRON

TRON DAO объявила о листинге фьючерсов на токен TRX на регулируемой CFTC американской бирже и клиринговой компании Bitnomial. Это предоставляет квалифицированным трейдерам и институциональным инвесторам в США новый регулируемый инструмент для хеджирования и управления экспозицией к экосистеме TRON. TRX — это собственный утилитарный токен блокчейна TRON, используемый для оплаты комиссий, исполнения смарт-контрактов и управления. Сеть TRON является крупной платформой для расчетов в стейблкоинах, с объемом циркулирующего USDT более $90 млрд и общей заблокированной стоимостью (TVL) свыше $26 млрд. По словам основателя TRON Джастина Сана, запуск фьючерсов на TRX расширяет возможности доступа к экосистеме через регулируемую площадку. Президент Bitnomial Майкл Данн отметил, что наличие регулируемого фьючерсного рынка в течение шести месяцев является важным этапом для потенциального запуска спотовых ETF на TRX в будущем. Ранее Bitnomial уже запустила спотовую торговлю TRX. Этот шаг усиливает институциональное присутствие TRON, которое также включает услуги кастоди и стейкинга через Anchorage Digital. Компания Bitnomial, базирующаяся в Чикаго, предлагает на единой платформе торговлю с использованием кредитного плеча спотовыми активами, перпетуальными контрактами, фьючерсами, опционами и рынками предсказаний.

TheNewsCryptoТолько что

На Bitnomial запущены фьючерсы на TRX, расширяя доступ к регулируемым производным инструментам США на TRON

TheNewsCryptoТолько что

Хакеры крадут сид-фразы криптокошельков из галереи изображений

Хакеры используют вредоносное ПО SparkKitty (ранее SparkCat) для кражи сид-фраз и паролей из криптокошельков. Вместо перехвата ввода программа сканирует фотографии и скриншоты на устройстве с помощью технологии оптического распознавания текста (OCR), обходя стандартные системы безопасности. Вредонос распространяется через зараженные приложения в официальных магазинах App Store и Google Play, маскируясь под легальные криптосервисы, мессенджеры и развлекательные платформы. Например, в App Store он был внедрен в приложение 币coin, скрыв код в обфусцированных модулях. В Google Play приложение SOEX было скачано более 10 000 раз под видом платформы для обмена сообщениями и криптовалютами. Получив доступ к галерее, программа незаметно отправляет найденные конфиденциальные данные на серверы злоумышленников. Завладев сид-фразой, хакеры могут полностью опустошить криптокошелек. Эксперты также отмечают рост атак на сессии Telegram Desktop в обход двухфакторной аутентификации для кражи криптоданных.

cryptonews.ru1 мин. назад

Хакеры крадут сид-фразы криптокошельков из галереи изображений

cryptonews.ru1 мин. назад

Прогноз цены на эспрессо: бычий импульс нарастает, поскольку ESP целится на $0.1208 после недельного ралли на 42%

Токен Espresso (ESP) продолжил рост после выхода из консолидации, поднявшись более чем на 42% за неделю. Цена достигла внутридневного пика около $0,121, после чего откатилась к $0,106. Ключевой уровень поддержки находится на $0,0960 (уровень Фибоначчи 0.618), а сопротивление — в зоне $0,1090–$0,1100 и на максимуме $0,1208. Закрытие выше $0,1208 может открыть путь к уровням $0,1300 и $0,1450. Рост подтверждается увеличением открытого интереса на рынке деривативов до $27,52 млн и появлением умеренных чистых притоков на спотовом рынке. Индикатор Stochastic RSI находится в зоне перекупленности (выше 80), что указывает на возможность краткосрочной коррекции или консолидации. Дальнейший рост зависит от удержания поддержки $0,0960 и преодоления сопротивления $0,1208. Прорыв ниже $0,0883 может усилить давление продаж и привести к коррекции до $0,0807.

cryptonews.ru4 мин. назад

Прогноз цены на эспрессо: бычий импульс нарастает, поскольку ESP целится на $0.1208 после недельного ралли на 42%

cryptonews.ru4 мин. назад

Торговля

Спот

Популярные статьи

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на SOL (SOL) представлены ниже.

活动图片