GPT-5.6 Sol一夜变笨,思考预算960砍到128,没智力固定的模型了?

marsbitОпубликовано 2026-07-15Обновлено 2026-07-15

Введение

近日,GPT-5.6 Sol模型的“Max档”深度推理能力被许多用户感知到明显下降,反应变快但思考变浅。一个日本开发团队率先报告,其用于复杂任务的Codex Sol MAX表现大幅下滑。社区调查发现,模型背后有一个OpenAI未公开的内部参数“juice value”,它代表推理算力预算。用户测得Sol的Max档该值从960骤降至128,同时可用上下文长度也从约372k缩回272k。 OpenAI负责人Tibo回应称,并未“降智”,而是进行了一场实验性调整。原因是GPT-5.6上线后,其深度推理、多智能体并行等新特性导致资源消耗远超预期,团队通过调低“juice values”来排查用量激增的来源,并承诺已改回原设置。他还提到,上下文窗口的暂时回调是为了解决计费异常,后续会重新开放。 此事揭示了云端AI服务的现实:用户付费购买的“固定智能”并不绝对,模型的实际推理资源配置(如思考时长、探索深度)可能被服务商在后台动态调整。当AI从实验室“奇迹”走向规模化生产工具,其性能与成本间的平衡常由平台掌控。争议的核心在于,如果AI要成为可靠的基础设施,服务商需要提供比模型名称更明确、透明的性能保障边界。

全网都说GPT-5.6 Sol的Max档变笨了,OpenAI偏说没降智,只是「做了个实验」,实验中拧动的那个旋钮,Max档从960掉到128,用户看不见。

一觉醒来,GPT-5.6 Sol变笨了!

一个日本的市场调研团队,早上开工没多久,就发现手里的Codex Sol MAX不太对劲,领队把这一上午的遭遇写成一个长帖,扔到了Reddit的r/codex上。

上午9点,该团队照常开工。到10点40分,全队每一个人都察觉到了同一件事。

他们把Codex Sol MAX接在一个自研的CLI工具上,专门啃那种需要极复杂计算和深度推理的活儿。

一开始,Codex Sol MAX也是不负众望,如果对它的要求水平是10分,它一直稳定地交出12分、13分,是一只「远超预期的怪物」,「每个人都对它满意到不行」。

但这天早上,这只「怪物」的表现忽然垮了下来,只剩8分。

推理的深度,明显被剥掉了。

在此之前,Codex Sol MAX面对一个提示词,会花掉十分钟以上,反复试、反复推、反复调用他们的工具,直到把活儿干得挑不出毛病。

但那种能力,就在这个早上「彻底消失了」。

全网都觉得它「变笨」了

这个日本团队的遭遇,只是这几天Codex社区里的一个缩影。

大家的抱怨高度一致:模型确实变快了,回答来得更利索了,但它不肯往深里挖了。以前那种先研究、再动手、边做边自我推翻的劲儿,没了。

X上网友的一句话,概括了所有人的体感:

所有人的推理档位被集体下调了一级——你原来跑Extra High,现在得把它拧到Max,才能换回原来那点力气。

这种变化,普通用户根本没法证明。

你看不到模型权重有没有换,也看不到服务端给你分了多少算力。

你能感知的只有四样东西:它回得多快,它想得多长,它有没有回头检查自己,它有没有叫上别的智能体一起干。

这些全是间接的信号,没有一样写在模型卡上。

于是,社区有网友自己去翻,翻出了一个OpenAI从来没公开过的内部参数:juice value。

一个官方从没提过的数字

OpenAI公开讲过的,只有推理档位。

7月9日GPT-5.6发布,官方原话是,首次引入max推理强度,「让Sol获得最充足的时间进行深度推理」。再往上还有ultra,默认拉起四个智能体并行干活。

落到ChatGPT里,就是模型选择器里那几个选项:Medium、High、Extra High,背后跑的都是Sol,Pro档跑的是Sol Pro。

而juice value,是这些档位底下的那层东西:内部的推理算力预算。用户看不到,OpenAI也从来没公布过它的取值。

社区用户ns123abc用一段被称作「模型指纹」的隐藏提示词,读到了系统配置里那个数值:juice。

此前社区观测到,Sol的max档对应960。这一次,屏幕上显示的是128,掉了将近87%。

几乎同时,另一组截图也开始传:Codex客户端里用户实际能用的上下文,从约372k退回了272k。

这两个数字,迅速点燃了整个社区。

Tibo:没有降智,我们在查用量

当晚,Tibo(Thibault Sottiaux)就出来说话了,他在OpenAI负责Codex与ChatGPT Work。

Tibo在X上发了一条更新,开头一句就说:没有nerf(降智),只有好事。

然后,他一口气强调了四点。

第一点,推理效率优化已经上线,省下来的算力回馈给所有订阅用户,光这一项就能多出大约10%的用量。

第二点,Sol的上下文上限被从GPT-5.5的272k提到了372k,结果导致计费比预期多扣了。现在已经退回272k,接下来几天再把372k放出去。

第三点,为了搞清楚多出来的用量到底从哪儿来,团队跑了一些实验,实验里改动了推理强度(reasoning effort),内部管它叫「juice values」。

现在已经改回去了。

第四点,high和xhigh档上多智能体的调用比预期的多,auto-review那边也有浪费,都在修。

Tibo的帖子大意是:不是「降智」,是「调参」。

模型权重动没动,他没提。但用户实际拿到的配置,确实动过:这一点他承认了。

juice到底是什么?从目前能看到的公开信息判断,它更接近系统内部的一个推理资源配置标记,粗略地说,就是系统允许模型在一项任务里投多少推理资源。

虽然预算调低,不等于「模型变弱了」,它仍可能悄悄改变很多东西:

长程任务能够探索多少条路线,多种方案之间会比较几轮,代码生成后会不会主动运行测试,失败之后愿意回滚多少次,以及极难任务中那一小部分决定成败的「长尾能力」等。

说到底,它代表的是模型肯在一个任务上花多少心思。

要终结这次争论,需要一场严格对照实验:同一份模型快照,同一批任务,同一套工具环境,只动juice这一个变量。

看看复杂编码、长程智能体、数学推理和错误恢复,到底会掉多少。

这份证据,到现在还是缺席的。

厂商省的每个token,用户都感觉得到

再回到Tibo口中的那场实验。它是怎么来的?

GPT-5.6上线之后,需求立刻井喷。

OpenAI一度把五小时窗口的使用限制临时放开,来接住汹涌而来的调用量。

而GPT-5.6最抢眼的几样新东西:max档更长的思考、ultra默认四个智能体并行、更大的上下文窗口,恰恰全是吃token的猛兽。

多出来的用量,正是从这里冒出来的。

于是就有了这场实验。为了查清账目,先把预算这个变量调低,看看用量究竟往哪儿跑,这在工程上完全说得通。

可问题也就出在这儿:厂商这边省token,用户那边是有感知的,最直观的,就是模型「不肯想了」。

那个被调动的变量,刚好是用户能感觉到的那个。

AI不再「显灵」,开始打卡上班

过去几年,大模型公司带给大家的是一种近乎宗教性的想象。

人们也把模型当神谕,指望它在某个深夜吐出一个人类没想到的答案,即使为此慢一点、贵一点、偶尔发疯,都能忍。

可实验室里的奇迹能够不计成本,但到了生产环节的工业基础设施上就不行。

于是Sol等前沿模型,开始从一个实验室中偶尔「显灵」的先知,变成一个能在日常工作流中不停运转的引擎。

这背后更像是一场智能驯化,而这场争议,等于把驯化的现场当众揭开了。同时,用户对「固定智能」的那点幻觉,也要从此结束了。

订阅一个模型,更像是买了一只灯泡:型号是固定的,但亮度旋钮,一直握在平台手里。

这在商业上可能是一个正确的选择,但它不该永远藏在黑箱里。

如果AI真要成为企业的基础设施,厂商就得给出比模型名称更具体的边界,让用户明白自己花钱买的那个Max,到底保证了什么。

否则,它就只是一张价签。

参考资料:

https://x.com/thsottiaux/status/2076495156757577895

https://x.com/FixlationAI/status/2076469274441380349

https://www.reddit.com/r/codex/comments/1uuy5eq/nerfed_codex_sol_max/

本文来自微信公众号“新智元”,作者:元宇

Трендовые криптовалюты

Связанные с этим вопросы

Q为什么用户普遍感觉GPT-5.6 Sol的Max档变笨了?

A用户感觉GPT-5.6 Sol的Max档变笨,主要是因为OpenAI进行了一项内部实验,暂时降低了模型推理资源的预算(juice value从960降至128)。这导致模型在处理复杂任务时,用于深度思考和迭代的资源减少,推理深度和反复验证的意愿下降,回答变得更快但更浅显,从而让用户感觉模型‘不肯想’了。

QOpenAI官方对用户反馈的模型‘降智’有何解释?

AOpenAI的负责人Tibo(Thibault Sottiaux)回应称,没有对模型进行‘降智’。他解释称,团队为了调查GPT-5.6上线后用户用量超出预期的原因,进行了一项实验,实验中临时调整了推理强度(即juice value)。他表示该调整是实验性的,现已恢复原状。他强调这是为了优化推理效率和排查用量问题,而非削弱模型能力。

Q文章中提到的‘juice value’具体是指什么?

A‘juice value’是OpenAI内部使用的一个未公开参数,它代表模型在单个任务上可投入的推理资源预算。这个值可以理解为系统允许模型对一个问题‘花多少心思’,它会影响模型探索的路径数量、方案比较轮次、错误恢复次数以及长尾复杂任务的完成度。用户无法直接看到或控制这个数值。

Q此次事件反映了AI服务提供中的什么矛盾?

A此次事件反映了AI服务提供商在平衡成本与用户体验之间的矛盾。厂商为了控制算力成本、优化效率或进行内部测试,可能会调整后端资源分配(如juice value),但这些调整直接影响模型输出的‘智力表现’。用户花钱购买的是期望中的固定性能,而实际得到的却是一个亮度可调的‘灯泡’,揭示了服务性能的非透明性和动态可变性,打破了用户对‘固定智能’的幻觉。

Q文章作者对未来的AI基础设施提出了什么期望?

A文章作者期望,如果AI要成为可靠的企业基础设施,厂商就不能将关键的性能控制参数完全置于黑箱之中。他们需要向用户提供比模型名称更具体、更明确的性能边界定义和保证,让用户清楚自己付费购买的(例如Max档位)具体包含哪些确定性的能力和资源承诺,而不仅仅是一张模糊的价签。

Похожее

В США призвали ограничить спортивные рынки предсказаний

Национальная футбольная лига (НФЛ) США обратилась к Комиссии по срочной биржевой торговле (CFTC) с призывом ужесточить регулирование рынков предсказаний на спортивные события. В письме от 27 июля лига заявила, что предложенные регулятором правила недостаточно защищают целостность спортивных соревнований и участников торгов. НФЛ предложила ограничить контракты на события, которыми могут манипулировать отдельные лица (например, промах кикера), и уточнить определение контрактов, неотличимых от азартных игр. Также лига раскритиковала возможные лазейки для обхода правил через включение элементов голосования в контракты. Отдельно НФЛ призвала прямо запретить торговлю на основе инсайдерской информации и ввести обязательные списки лиц, которым запрещено торговать контрактами по конкретным соревнованиям. Были повторены требования о запрете маржинальной торговли, ограничении рекламы и установлении возрастного порога в 21 год. Параллельно продолжается спор о юрисдикции между CFTC и отдельными штатами, которые считают, что платформы нарушают местные законы об азартных играх. Несмотря на судебные разбирательства в некоторых штатах, как Kalshi, так и Polymarket показали значительный рост объемов торгов в июне, обойдя традиционные букмекерские конторы во время чемпионата мира по футболу.

cryptonews.ru6 мин. назад

В США призвали ограничить спортивные рынки предсказаний

cryptonews.ru6 мин. назад

Песков заявил, что Россия входит в пятерку лидеров гонки ИИ. Что говорят мировые рейтинги?

Россия остается в пятерке лидеров гонки ИИ, заявил пресс-секретарь президента РФ Дмитрий Песков. Он отметил, что отечественные разработки достигли высокого уровня, хотя пока уступают ведущим американским моделям, и для ликвидации отставания потребуются «нечеловеческие усилия». Однако международные рейтинги не подтверждают это заявление. Согласно Global AI Vibrancy Tool Стэнфордского университета (2024-2025), Россия занимает лишь 28-е место. В отчете Stanford AI Index Report 2026 позиция РФ не упоминается среди лидеров, которыми остаются США и Китай. На русскоязычной LM Arena лучшая российская модель, GigaChat, заняла только 25-е место. Власти РФ принимают меры для развития отрасли: подписан закон о суверенных больших моделях ИИ, дающий доступ к госданным, а Россия вошла в состав учредителей Всемирной организации сотрудничества в области ИИ (WAICO) в Шанхае. Разрыв между заявлениями и рейтингами объясняется разными критериями оценки. В то время как отечественные модели развиваются и конкурируют внутри страны, они пока проигрывают зарубежным аналогам по бенчмаркам и стоимости использования. Ключевым вызовом остается аппаратный дефицит, связанный со сложностями в импорте вычислительных мощностей, что не решается только законодательными мерами.

cryptonews.ru6 мин. назад

Песков заявил, что Россия входит в пятерку лидеров гонки ИИ. Что говорят мировые рейтинги?

cryptonews.ru6 мин. назад

Всего один шаг остался. В чём же загвоздка с законопроектом Clarity?

Автор Azuma (@azuma_eth) обсуждает сложную ситуацию вокруг закона о структуре рынка цифровых активов США («Закон ясности»), принятие которого откладывается из-за разногласий по поводу «этического положения». Несмотря на то, что Белый дом согласился включить в законопроект положение, ограничивающее торговлю цифровыми активами для высших госслужащих, между демократами и республиканцами сохраняются серьёзные разногласия. Демократы критикуют предложенную версию, поскольку правоохранительные полномочия будут переданы Министерству юстиции, которое они считают недостаточно независимым, особенно учитывая, что нынешний и.о. генерального прокурора Тодд Бланш ранее был личным адвокатом Дональда Трампа. Кроме того, положение истекает в январе 2029 года, что совпадает с окончанием возможного срока Трампа, что, по мнению демократов, создаёт лазейку. Также их беспокоит, что ограничения могут не распространяться на косвенные схемы с участием членов семьи. Сенатор-демократ Элизабет Уоррен резко раскритиковала законопроект. Группа из семи демократических сенаторов, ведущих переговоры, также заявила, что текущий текст «не соответствует ожиданиям». Республиканцы, в свою очередь, утверждают, что президент пошёл на исторические уступки. Времени на решение этих споров остаётся мало. Конгресс США уходит на летние каникулы 7 августа, а график Сената заполнен другими срочными законопроектами, такими как санкции против России. По мнению аналитиков, шансы на принятие закона в этом году оцениваются всего в 30%. Таким образом, хотя регулирование крипторынка находится в шаге от принятия, эта «последняя черта» может оказаться самой сложной для преодоления.

marsbit21 мин. назад

Всего один шаг остался. В чём же загвоздка с законопроектом Clarity?

marsbit21 мин. назад

Не хватает последнего удара: в чём главное препятствие для Закона о ясности?

До летнего перерыва в Конгрессе США (начинается 7 августа) остаются считанные рабочие дни, и времени на прохождение «Закона о структуре рынка цифровых активов» (Clarity Act) в Сенате почти не осталось. Основное препятствие — спорные детали «этической поправки», регулирующей участие высших госслужащих в операциях с криптоактивами. Несмотря на то, что Белый дом включил поправку, ограничивающую возможности президента, вице-президента и членов Конгресса извлекать выгоду из цифровых активов, демократы выступили против её текущей формулировки. Они критикуют предоставление исключительных прав по обеспечению соблюдения Министерству юстиции (глава которого — бывший личный адвокат Трампа), пункт об автоматическом истечении действия нормы в 2029 году (после окончания возможного срока Трампа) и недостаточный охват косвенных способов получения прибыли, например, через членов семьи. Семь демократических сенаторов, ведущих переговоры, заявили, что текст «не соответствует ожиданиям». Республиканцы, в свою очередь, считают, что пошли на исторические уступки. Лидер большинства в Сенате Джон Тун отложил рассмотрение закона для решения других вопросов, а из-за похорон сенатора Грэма время ещё больше сократилось. Закон может быть поставлен на голосование только на следующей неделе, в последние дни перед перерывом, и ему придется конкурировать за время с другими важными законопроектами. Из-за этих разногласий и сжатых сроков аналитики, такие как Алекс Торн из Galaxy, снизили вероятность принятия закона в 2026 году до 30%. Криптоиндустрия ожидает решения, но «последний рывок» оказался самым трудным.

Odaily星球日报26 мин. назад

Не хватает последнего удара: в чём главное препятствие для Закона о ясности?

Odaily星球日报26 мин. назад

От песка до чипа: алхимия полупроводников в Хэфэе

27 июля 2026 года компания Changxin Technology, производитель микросхем памяти DRAM из Хэфэя, вышла на IPO на Шанхайской фондовой бирже с капитализацией 3,28 трлн юаней, превзойдя Industrial and Commercial Bank of China. Этот успех стал результатом долгосрочной стратегии города по развитию полупроводниковой индустрии. В 2016 году Хэфэй и компания GigaDevice запустили «Проект 506» с общими инвестициями в 150 млрд юаней для создания национального производства DRAM. К 2019 году Changxin выпустила первую отечественную микросхему DDR4. Несмотря на убытки в первые годы, к 2025 году компания вышла на прибыльность благодаря росту спроса на DRAM для ИИ и повышению эффективности производства. К Q1 2026 года её рыночная доля достигла 8%, что сделало её четвёртым игроком в мире. Успех Changxin стал катализатором для создания полноценного кластера в Хэфэе. Вокруг завода сконцентрировались десятки компаний-поставщиков оборудования (Northern Huachuang, AMEC), материалов и услуг, а также клиентов, таких как Xiaomi и Alibaba Cloud. Индустрия интегральных схем города выросла с 18 млрд юаней в 2016 году до 151,4 млрд в 2025. Это часть масштабной промышленной трансформации Хэфэя, известной как «три скачка»: от экранов (BOE) к чипам (Changxin) и затем к электромобилям (Nio, BYD). Стратегия «долгого цикла» превратила город из периферийного в экономического лидера с ВВП в 1,42 трлн юаней (2025 г.) и привлекательными условиями для жизни и работы.

marsbit35 мин. назад

От песка до чипа: алхимия полупроводников в Хэфэе

marsbit35 мин. назад

Торговля

Спот

Популярные статьи

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на SOL (SOL) представлены ниже.

活动图片