GPT-5.6 скоро будет запущен, скорость рассуждений взлетела до 750 токенов в секунду, подозревается работа на 100 кремниевых пластинах

marsbitОпубликовано 2026-07-09Обновлено 2026-07-09

Введение

По данным утечек, OpenAI готовится к запуску GPT-5.6 Sol — новой высокоскоростной версии своей модели. Как утверждается, она будет работать на оборудовании Cerebras с феноменальной скоростью генерации в 750 токенов в секунду, что позволит выполнять сложные задачи почти мгновенно. Ключевым техническим прорывом, по мнению экспертов, является архитектура развертывания, при которой каждый слой нейронной сети размещается на отдельной пластине (wafer) чипа Cerebras. Это позволяет масштабировать модель до 3 триллионов параметров, используя от 70 до 100 таких пластин. Для преодоления ограничений памяти также применяются оптимизированные, облегченные методы кэширования KV, возможно, в сочетании с гибридными архитектурами, подобными Mamba. OpenAI параллельно развивает собственную экосистему, представив свой первый специализированный чип для вывода ИИ — Jalapeño. Это демонстрирует стратегию компании по созданию полного стека технологий: от проектирования моделей и чипов до оптимизации развертывания. Цель — построить масштабируемую инфраструктуру для следующего поколения сверхбыстрого и мощного искусственного интеллекта.

【Резюме】Скорость рассуждений GPT-5.6 достигла ошеломляющих 750 токенов в секунду! Профессиональные эксперты раскрыли внутреннюю информацию: он будет работать на 100 кремниевых пластинах. ИИ превращается из размышляющего в мгновенный, действительно ли наступает эпоха реального времени интеллекта?

Согласно различным источникам, GPT-5.6 скоро будет открыт для всех.

В последнее время различные предположения об этой модели уже стали популярными на X.

26 июня OpenAI официально объявил о новом семействе GPT-5.6.

И в официальном блоге было сказано: OpenAI планирует выпустить в этом месяце на пользовательском оборудовании от чипового гиганта Cerebras новейшую передовую модель — GPT-5.6 Sol, скорость рассуждений которой достигает пугающих 750 токенов в секунду!

Это означает, что сложные операции с агентами, которые раньше требовали нескольких минут ожидания, теперь можно выполнить в мгновение ока.

Очевидно, OpenAI уже сделал революционный шаг в совместном проектировании аппаратного обеспечения и моделей.

Кроме того, после недавнего первого в истории появления собственного чипа для логического вывода ИИ Jalapeño, мы можем почувствовать, что у OpenAI появились амбиции стать полноценной империей ИИ.

В мире боевых искусств нет ничего важнее скорости: разрушительный удар в 750 токенов/с

Что означает «750 токенов в секунду»?

Для человека это эквивалентно чтению и выводу примерно 500-600 китайских иероглифов в секунду.

Этот текст перед вами GPT-5.6 Sol может сгенерировать менее чем за долю секунды.

На X известный разработчик Калеб Шеперд взволнованно заявил: «Это то, что меня больше всего волнует, GPT-5.6 Sol работает на Cerebras. Не только потому, что написание кода стало быстрее, но и потому, что скорость использования компьютера претерпела качественные изменения. Нам больше не придется ждать две минуты, пока ИИ нажмет кнопку».

Долгое время, хотя большие модели становились умнее, «задержка логического вывода» была главным узким местом для развертывания в задачах многошаговых агентов в реальном времени.

Когда модель становится настолько большой, что имеет триллионы параметров, традиционные кластеры GPU часто сталкиваются с физическими ограничениями в межузловой связи (NVLink).

Ответ OpenAI таков: не заставляйте модель адаптироваться к аппаратному обеспечению, а объедините аппаратное обеспечение и модель в одно целое.

Согласно предварительной информации, раскрытой компанией, GPT-5.6 Sol в июле будет открыт в крайне ограниченном масштабе для определенных клиентов, и его распространение будет постепенно расширяться по мере роста производственных мощностей.

Как все догадываются в интернете, это чрезвычайно дорогая услуга, привилегия, созданная специально для ведущих компаний, готовых платить за скорость.

Как вместить 3-триллионного гиганта параметров в чип?

Когда появилась новость о 750 токенах/с, руководитель LLM Arena Питер Гостев задал вопрос, который волновал всех:

Что происходит с GPT-5.6 Sol на Cerebras? Насколько я знаю, это, кажется, полная та же самая модель (включая визуальные и другие мультимодальные возможности), а не урезанная версия, лишенная зрения и контекста, как раньше GPT-5.3-Codex-Spark.

Но я понимаю, что на одном чипе Cerebras может поместиться модель максимум на 700-900 миллиардов параметров. Итак, модель уменьшилась? Или появился новый тип чипа, о котором я не знаю? Или какая-то новая технология многочиповой кооперации?

Этот вопрос сразу вызвал множество дискуссий среди пользователей.

Кто-то в шутку заметил, что люди занимаются «судебно-медицинским аудитом чипов в полночь», и сказал: «Если это действительно полная версия той же модели, то это похоже на то, как кто-то засунул суперъяхту в стеклянную бутылку, не объясняя, как это сделано».

Вскоре старший технический эксперт Блейс Гудсон представил чрезвычайно убедительный технический анализ —

GPT-5.6 Sol не помещен на один чип, а распределен на 70-100 пластинчатых чипов Cerebras!

Эстетика предельного развертывания: «Одна пластина — один слой сети»

По оценкам отраслевых экспертов, спецификации GPT-5.6 Sol чрезвычайно огромны:

  • Общее количество параметров: около 3 триллионов
  • Активные параметры: около 150 миллиардов
  • Количество слоев сети: около 70-90

Чтобы получить здоровые характеристики службы логического вывода, OpenAI и Cerebras использовали чрезвычайно роскошный и впечатляющий способ развертывания — каждый слой нейронной сети размещается на отдельной целой пластине Cerebras.

Как отметил один пользователь, увеличивая количество конвейерных этапов, теоретически можно масштабироваться до модели любого размера, если у вас достаточно пластин, чтобы связать их вместе. Это не повлияет на скорость генерации токенов, возможно, лишь незначительно повлияет на время до первого токена (TTFT).

Перестройка архитектуры от отчаяния — облегченный кэш KV, рожденный необходимостью

Однако, одних пластин недостаточно. Особенность архитектуры чипов Cerebras — огромное количество встроенной SRAM (статической оперативной памяти), которая очень быстра, но имеет крайне ограниченную емкость.

Если бы OpenAI, как и раньше, использовал традиционный тяжелый кэш ключей и значений (KV Cache) в GPT-5.6 Sol, то пропускная способность этой дорогой SRAM была бы мгновенно исчерпана.

Это приводит к самому важному стратегическому повороту в этом сотрудничестве: рефакторинг модели под конкретное аппаратное обеспечение.

Блейс Гудсон отмечает, что, поскольку OpenAI глубоко участвовал в совместном проектировании оборудования, они, скорее всего, отказались от традиционной схемы кэширования механизма внимания и перешли к более передовому облегченному дизайну.

Наиболее вероятные варианты включают:

Архитектуру, подобную DeepSeekV4: чрезвычайная оптимизация использования кэша.

Гибридный дизайн SSM: объединение моделей с линейной временной сложностью, таких как Mamba, с Transformer, полностью избавляясь от исторического бремени KV Cache.

Кроме того, известный разработчик Джон Лам выдвинул захватывающую гипотезу — разделение внимания и FFN (прямого распространения).

Он предполагает, что OpenAI, возможно, использует традиционные GPU для вычислений внимания, а массивные пластины Cerebras — для мощного выполнения вычислений в части прямого распространения нейронной сети.

Это не беспочвенная догадка. Пользователи быстро раскопали детали развертывания Kimi K2.6, о которых Cerebras ранее писала в блоге:

Cerebras хранит исходные веса Kimi K2.6 в системе CS-3 с 4-битной точностью, одновременно вычисляя с 16-битной плавающей запятой для обеспечения точности. Веса распределены по нескольким пластинам, значения активации передаются потоком между пластинами. Полная взаимосвязь между слоями полностью зависит от сетевой структуры на пластине, ее пропускная способность более чем в 200 раз выше, чем у NVLink на Nvidia NVL72! В сочетании с пользовательскими операторами и спекулятивным декодированием они могут запускать триллионные MoE-модели со скоростью, близкой к 1000 токенов/с.

Официальные спецификации показывают, что революционная система CS-3 не только непревзойденно быстра, но и может легко масштабироваться до модели с 24 триллионами параметров на одном логическом устройстве!

Как воскликнул один из пользователей: «Если это действительно полная версия Sol, работающая на Cerebras, то сегодня ночью потолок размера модели, который все предполагали, был пробит».

Настоящий козырь — собственный чип OpenAI «Jalapeño»

И как раз до этого OpenAI официально выпустил свой первый в истории собственный чип — Jalapeño.

Появление этого чипа напрямую объясняет глубинную логику сотрудничества OpenAI с Cerebras: исследуя стороннее передовое оборудование для логического вывода, OpenAI полностью изучило особенности и ценность специализированной архитектуры логического вывода и превратило их в контролируемую низкоуровневую платформу.

Jalapeño — один из самых мягких по остроте сортов мексиканского перца. Назвав его так, OpenAI явно дает понять: это лишь легкая закуска.

Этот чип — это специализированная ASIC, разработанная для логического вывода больших моделей. С момента создания первой линии каждый его транзистор оптимизирован только для одной цели: запуск больших моделей.

Неожиданно, что Jalapeño не только запускает собственные модели OpenAI, его архитектура также совместима с LLM всей отрасли, демонстрируя огромные амбиции платформы.

И проектирование и производство этого чипа заняли всего 9 месяцев.

За этим стоит чрезвычайно мощный промышленный альянс:

Ведущая архитектура: OpenAI лично руководит проектированием низкоуровневой архитектуры.

Реализация чипа и взаимосвязь: Чиповый гигант Broadcom предоставляет мощные возможности реализации и технологическую поддержку сетевой взаимосвязи.

Системная интеграция: Celestica отвечает за окончательное производство плат и физическую интеграцию на уровне стоек.

Поглощение всей цепочки создания стоимости: амбиции OpenAI по созданию полноценной империи

Модели обучают сами, чипы проектируют сами, логический вывод оптимизируют сами, развертывание контролируют сами.

Очевидно, цель OpenAI — создание огромной полноценной империи ИИ.

Но амбиции OpenAI безумнее, чем у Apple и Google, у них есть беспрецедентное суперколесо: использовать ИИ для ускорения строительства инфраструктуры ИИ, а затем использовать созданную, более мощную инфраструктуру для запуска еще более мощного ИИ.

Согласно грандиозному плану, опубликованному OpenAI, первые суперцентры обработки данных гигаваттного уровня начнут развертываться совместно с ключевыми партнерами, такими как Microsoft, с конца 2026 года.

Вся электроэнергия среднего города будет использоваться для питания стоек логического вывода на чипах Jalapeño и следующего поколения «перцовых» чипов.

Приготовьтесь, скоро мы встретим GPT-5.6 Sol, мчащийся на пластинах Cerebras со скоростью 750 токенов/с, ломающий физические ограничения параметров и скорости логического вывода.

Источники: https://x.com/bleysg/status/2073937651150029084

Эта статья взята с официального аккаунта WeChat «Xin Zhi Yuan», автор: ASI启示录; редактор: Aeneas

Трендовые криптовалюты

Связанные с этим вопросы

QКакая заявленная скорость вывода у GPT-5.6 Sol и на каком аппаратном обеспечении она достигается?

AЗаявленная скорость вывода GPT-5.6 Sol составляет 750 токенов в секунду. Эта скорость достигается за счет работы модели на специализированном аппаратном обеспечении компании Cerebras, в частности, на их чипах Wafer-Scale Engine (WSE).

QСколько кристаллов (вафель) Cerebras, по предположениям экспертов, может использовать GPT-5.6 Sol, и почему?

AПо предположениям экспертов, GPT-5.6 Sol может быть распределена по 70-100 кристаллам (вафлям) Cerebras. Такая архитектура необходима для размещения огромной модели с примерно 3 триллионами параметров. Применяется подход «один кристалл — один слой сети», что позволяет эффективно масштабировать модель, практически не влияя на скорость генерации токенов.

QКакие ключевые технические изменения в архитектуре модели могли позволить GPT-5.6 Sol достичь такой высокой скорости вывода?

AДля достижения высокой скорости вывода OpenAI, вероятно, провела глубокую реконструкцию модели, оптимизированную под конкретное оборудование Cerebras. Ключевые изменения могут включать: отказ от традиционного тяжёлого KV-кэша в пользу облегчённых схем (как в DeepSeek-V4), использование гибридных архитектур (например, комбинация Transformer и SSM-моделей, таких как Mamba), а также возможное разделение вычислений внимания (Attention) и прямого распространения (FFN) между разными аппаратными платформами.

QЧто представляет собой собственный чип OpenAI «Jalapeño» и какова его роль в стратегии компании?

A«Jalapeño» — это первый собственный специализированный чип (ASIC) от OpenAI, разработанный специально для задач вывода (инференса) больших языковых моделей. Его роль заключается в том, чтобы дать OpenAI полный контроль над аппаратным стеком, снизить зависимость от сторонних поставщиков (таких как NVIDIA) и оптимизировать производительность и стоимость выполнения своих моделей. Его создание сигнализирует о стремлении OpenAI построить «полноценный стек» (full-stack) AI-империю.

QКакова конечная цель OpenAI в контексте создания собственных чипов и сотрудничества с такими компаниями, как Cerebras?

AКонечная цель OpenAI — построить полноценную AI-империю, контролирующую всю технологическую цепочку: от проектирования моделей и архитектур до создания специализированного аппаратного обеспечения (чипов, таких как Jalapeño) и развёртывания сверхмощных дата-центров. Сотрудничество с Cerebras позволяет изучить и отточить технологии инференса на передовом оборудовании, чтобы затем воплотить эти знания в собственных, более эффективных и масштабируемых решениях. Это часть стратегии по созданию «сверхмощного маховика», где AI ускоряет разработку инфраструктуры для AI.

Похожее

Чжун Шаньшань вложился в Лян Вэньфэна

Китайский предприниматель и богатейший человек страны Чжун Шаньшань, основатель компаний Nongfu Spring и Wantai Biological Pharmacy, через свой инвестиционный фонд Guanzi Capital косвенно инвестировал около 350 миллионов юаней в компанию DeepSeek, занимающуюся разработкой ИИ. Эта инвестиция стала частью первого раунда финансирования DeepSeek, в котором также участвовали Tencent, CATL, NetEase, JD.com и другие крупные игроки. Чжун Шаньшань известен своей сдержанностью и избирательным подходом к инвестициям. Его фонд Guanzi Capital, созданный в 2021 году, ранее фокусировался преимущественно на секторах здравоохранения и новых материалов. Инвестиция в DeepSeek — его первая крупная ставка на быстроразвивающийся рынок больших языковых моделей (LLM). Помимо Guanzi Capital, инвестиционная деятельность Чжун Шаньшаня ведется через структуры Qian Tang New Materials Laboratory и Kunshan Gewu Zhizhi Fund, формируя обширный портфель в области высоких технологий. В раунде финансирования DeepSeek также заметно участие других представителей «старых денег» — капитала из традиционных отраслей. Например, медицинская компания Jiuan Medical, производитель биодобавок By-Health и даже производитель одежды Septwolves (через свою инвестиционную структуру) стали косвенными инвесторами DeepSeek. Эти компании также активно инвестируют в другие перспективные AI-стартапы, такие как Moon Dark Side, StepFun и Astribot. Тенденция показывает, как состоявшиеся предприниматели и корпорации из «реальной» экономики перенаправляют свои ресурсы и капитал в высокотехнологичные сектора, стремясь занять место в новой технологической эре, особенно в сфере искусственного интеллекта.

marsbit7 мин. назад

Чжун Шаньшань вложился в Лян Вэньфэна

marsbit7 мин. назад

Глава исследовательского отдела CryptoQuant указывает на следующую точку сопротивления для биткоина! Вот подробности

Биткоин торгуется выше $80 000, и ключевым уровнем сопротивления становятся $83 000. Хулио Морено, глава отдела исследований CryptoQuant, указал, что 365-дневная скользящая средняя (около $83 000) на дневном графике представляет собой значительный барьер, который можно считать «последним боссом» в текущем восходящем тренде. Прорыв выше этого уровня может открыть путь для дальнейшего роста. На момент публикации биткоин торговался около $80 868, и до ключевой отметки оставалось около $2 100. Если биткоину не удастся преодолеть сопротивление в $83 000, это может привести к краткосрочной фиксации прибыли или консолидации рынка. Инвесторам важно следить за движением цены в этом диапазоне для определения краткосрочной динамики.

cryptonews.ru15 мин. назад

Глава исследовательского отдела CryptoQuant указывает на следующую точку сопротивления для биткоина! Вот подробности

cryptonews.ru15 мин. назад

Джексон Холл стал ключевым сражением для американских облигаций: Bank of America предупреждает, если Уорш не подаст сигнал о повышении ставок, доходность 30-летних облигаций может взлететь до 5.5%

Предстоящее выступление председателя ФРС Кевина Уорша на симпозиуме в Джексон-Хоуле рассматривается рынком как ключевое событие для определения траектории доходности казначейских облигаций и курса доллара. В контексте усиления выкупа долгосрочных гособлигаций Минфином США и ослабления доллара сигналы ФРС по борьбе с инфляцией будут иметь решающее значение. Как предупреждают стратеги Bank of America, если Уорш не даст четких разъяснений относительно перспектив инфляции и возможной реакции денежно-кредитной политики, доходность 30-летних казначейских облигаций может быстро достичь 5,5% или выше, а доллар столкнется с новым раундом продаж. Баркли также считает, что вероятность того, что Уорш заявит о готовности ФРС возобновить повышение ставок в случае ухудшения инфляции, превышает 50%. Исторически влияние Джексон-Хоула на рынки было ограниченным. Однако текущая ситуация отличается: рынки облигаций и доллара уже находятся под давлением, а Министерство финансов уже вмешалось для сдерживания долгосрочных доходностей. Если Уорш не оправдает минимальных ожиданий рынка относительно политической позиции ФРС, это выступление может стать одним из самых значимых за последние годы, способным спровоцировать резкие движения на рынках.

marsbit16 мин. назад

Джексон Холл стал ключевым сражением для американских облигаций: Bank of America предупреждает, если Уорш не подаст сигнал о повышении ставок, доходность 30-летних облигаций может взлететь до 5.5%

marsbit16 мин. назад

Cardano CIP-0197 нацелен на квантово-защищенную защиту кошельков

Кардано начал официальное рассмотрение предложения CIP-0197, целью которого является добавление дополнительного, опционального уровня защиты кошельков от будущих угроз со стороны квантовых компьютеров. Предложение, разработанное исследователем Робертом Фэйром, использует слой доказательств с нулевым разглашением (zero-knowledge proofs) для усиления безопасности иерархических детерминированных кошельков, позволяя пользователям повысить защиту существующих адресов без немедленной миграции ключей. Важно подчеркнуть, что CIP-0197 пока не активирован в основной сети Кардано, не является обязательным и не представляет собой срочный ответ на непосредственную квантовую атаку. Это ранняя, превентивная работа, демонстрирующая, что сообщество блокчейна серьезно задумывается о долгосрочной криптографической устойчивости. Квантовые компьютеры пока не представляют повседневной угрозы для обычных пользователей, но криптосетям необходимо планировать заранее, так как переход на новые стандарты требует много времени. Массовая миграция кошельков сопряжена с трудностями: пользователи теряют ключи, требуется согласованность между кошельками, биржами и децентрализованными приложениями. Опциональный защитный слой, предлагаемый в CIP-0197, может обеспечить Кардано более плавный путь к устойчивости. Сейчас предложение проходит этап технической оценки и обратной связи от сообщества. Его дальнейшая судьба будет зависеть от практичности, эффективности и совместимости с существующей инфраструктурой. Независимо от исхода, эта дискуссия полезна, так как заставляет экосистему заранее продумать стратегию перехода до того, как угроза станет актуальной.

bitcoinist17 мин. назад

Cardano CIP-0197 нацелен на квантово-защищенную защиту кошельков

bitcoinist17 мин. назад

«Экономический изгой»: Минфин США взял под прицел крипту, технологии и золото Ирана

24 августа 2026 года Минфин США запустил масштабную операцию «Economic Outcast» («Экономический изгой») против Ирана. Цель — перекрыть финансовые источники, поддерживающие режим, особенно Корпус стражей исламской революции (КСИР). Управление по контролю за иностранными активами (OFAC) получило право вводить санкции против любого лица, работающего в пяти ключевых секторах иранской экономики: цифровые активы (криптовалюта), технологии, золото, авиация и судоходство. Особо отмечено, что Тегеран активно использует криптовалюту для обхода ограничений. В рамках кампании уже введены санкции против почти 60 организаций, лиц и судов, связанных с распространением технологий, кибератаками и продажей нефти. Госдепартамент США подключился к давлению, нацелившись на иранских военных и нефтяные сети. Вашингтон поставил ультиматум иностранным партнёрам с конкретными сроками прекратить сотрудничество с Ираном, угрожая отключением от долларовой системы. Операция объединяет санкции по разным направлениям в единую скоординированную кампанию, демонстрируя готовность США к дальнейшему расширению ограничений.

cryptonews.ru32 мин. назад

«Экономический изгой»: Минфин США взял под прицел крипту, технологии и золото Ирана

cryptonews.ru32 мин. назад

Торговля

Спот

Популярные статьи

Как купить S

Добро пожаловать на HTX.com! Мы сделали приобретение Sonic (S) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Sonic (S).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Sonic (S)После приобретения вами Sonic (S) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Sonic (S)С легкостью торгуйте Sonic (S) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

2.0k просмотров всегоОпубликовано 2025.01.15Обновлено 2026.06.02

Как купить S

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

Он решает проблемы масштабируемости, совместимости между блокчейнами и стимулов для разработчиков с помощью технологических инноваций.

2.5k просмотров всегоОпубликовано 2025.04.09Обновлено 2025.04.09

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

HTX Learn — ваш проводник в мир перспективных проектов, и мы запускаем специальное мероприятие "Учитесь и Зарабатывайте", посвящённое этим проектам. Наше новое направление .

2.0k просмотров всегоОпубликовано 2025.04.10Обновлено 2025.04.10

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на S (S) представлены ниже.

活动图片