За одну ночь GPT-5.6 Sol от OpenAI был ускорен в 14 раз

marsbitОпубликовано 2026-08-14Обновлено 2026-08-14

Введение

OpenAI совместно с производителем AI-чипов Cerebras представили предварительную версию нового сервисного уровня «Ultrafast Mode» для своей флагманской модели GPT-5.6 Sol. В этом режиме скорость вывода модели достигает 750 токенов/с, что в 14 раз быстрее стандартного режима (53 токенов/с), без потери качества. По сравнению с конкурентами, ускоренная версия GPT-5.6 Sol оказалась в 11 раз быстрее Fable 5 и в 5 раз быстрее Opus 4.8 в быстром режиме. В ходе тестирования на сложном наборе задач «Humanity's Last Exam» (HLE), состоящем из 2500 вопросов уровня докторантуры, GPT-5.6 Sol в Ultrafast Mode справилась со всеми вопросами за 11 часов 11 минут, в то время как Claude Fable 5 потребовалось более 78 часов. Прорыв в скорости стал возможен благодаря уникальной архитектуре Cerebras на основе целых кремниевых пластин (Wafer-Scale Engine, WSE-3). Чип содержит 4 триллиона транзисторов, 125 петафлопс вычислительной мощности и 44 ГБ сверхбыстрой SRAM-памяти на кристалле. Это позволяет хранить параметры модели непосредственно на чипе, избегая задержек на загрузку из внешней памяти, характерных для традиционных GPU-кластеров. Новый режим открывает возможности для применения в сценариях, требующих мгновенной реакции: анализ сбоев в реальном времени, финансовая аналитика, сложная поддержка клиентов, интерактивные исследования и ускорение рабочих процессов агентов ИИ.

ИИ начал играть на информационном неравенстве?

14 августа в ранние часы OpenAI совместно с производителем AI-чипов Cerebras анонсировали предварительный просмотр нового сервисного уровня «Ультрабыстрый режим» (Ultrafast Mode) для своего флагманской модели GPT-5.6 Sol.

В этом режиме скорость вывода GPT-5.6 Sol может достигать 750 токенов/с, что по сравнению с базовой скоростью вывода в стандартном режиме (Standard) около 53 токенов/с, означает ускорение до 14 раз без потери качества. В поперечном сравнении, ускоренный GPT-5.6 Sol в 11 раз быстрее Fable 5 и в 5 раз быстрее Opus 4.8 в быстром режиме (Fast).

Ultrafast Mode будет сначала внедрён в OpenAI API, а в настоящее время уже доступен ограниченный предварительный просмотр для некоторых клиентов.

Для этого OpenAI и Cerebras также представили таблицу, сравнивающую текущую скорость и интеллект современных больших языковых моделей, где GPT-5.6 Sol Ultrafast занимает абсолютно лидирующую позицию:

В блоге Cerebras инженеры описали тесты, проведённые на «Последнем экзамене человечества» (Humanity's Last Exam, HLE), где они сравнили модель в Ultrafast-режиме с прямыми конкурентами. Как известно, HLE — это сложный бенчмарк для моделей, содержащий 2500 вопросов, на которые обычно способны ответить только доктора наук в таких областях, как химия, экономика и литература.

GPT-5.6 Sol в ультрабыстром режиме ответил на все вопросы всего за 11 часов 11 минут. В то время как Claude Fable 5 потребовалось 78 часов 27 минут, то есть более трёх дней непрерывных вычислений для получения тех же выводов. Сопоставимая точность при почти 7-кратном преимуществе в скорости — ультрабыстрый режим GPT выполнил задания на переднем крае человеческих знаний всего за один рабочий день.

По мере роста возможностей моделей расширяется и область применения быстрого вывода. GPT-5.6 Sol — лучшая модель OpenAI на сегодняшний день в работе с юридическими документами, финансовыми моделями и инженерными отчётами. На бенчмарке GDP-Val (измеряющем экономически ценную интеллектуальную работу) Ultrafast обеспечил сквозное ускорение в 5,6 раза без ущерба для качества, что наглядно демонстрирует, как более высокая скорость вывода может ускорить выполнение экономически значимых задач.

Более быстрая обработка ИИ открывает новые возможности для рабочих процессов, позволяя теперь развертывать агентов на критических участках решения проблем. OpenAI приводит несколько примеров применения:

  • Реагирование на инциденты и надёжность: при сбое критической системы ИИ анализирует журналы приложений, последние изменения кода и отчёты инженеров, чтобы определить возможные причины и помочь подготовить исправления, пока инцидент ещё продолжается.
  • Финансовые исследования и безопасность: анализ рыночных сигналов, оценка сделок и выявление подозрительной активности в условиях быстро меняющейся рыночной ситуации.
  • Поддержка клиентов и голосовые интерфейсы: решение сложных вопросов клиентов в реальном времени, даже если для поиска ответа требуется несколько шагов или систем, без прерывания диалога.
  • Электронная коммерция: ответы на вопросы о продуктах, проверка наличия, персонализированные рекомендации и решение проблем при оформлении заказа, пока покупатель ещё колеблется, предотвращая превращение нерешительности в отказ от корзины.
  • Исследования и эксперименты в реальном времени: превращение исследований, которые раньше требовали ночи, в интерактивные рабочие сессии, позволяя командам проверять идеи, изучать результаты, корректировать подходы и проводить следующий эксперимент без нарушения рабочего процесса.

Внутри OpenAI разработчики протестировали GPT-5.6 Sol в ультрабыстром режиме, и реагирование на инциденты — один из примеров использования Ultrafast. При срабатывании оповещения инженерам необходимо быстро составить точную картину происходящего, пока системы и свидетельства ещё меняются. Благодаря интеллекту уровня Sol команды могут быстро считывать журналы, анализировать трассировки, обобщать диалоги, определять следующие шаги проверки и помогать в подготовке или проверке исправлений. Режим Ultrafast сокращает задержку между наблюдением сигнала, проверкой гипотез и выбором следующего действия, при этом суждение и развертывание остаются за инженером.

В области исследований команда OpenAI использует Ultrafast для быстрого поиска по базам знаний, запросов к данным, а также оперативного сбора, организации и обобщения информации из различных инструментов. Распространённый ранее исследовательский процесс, когда члены команды запускали пакет экспериментов ночью и просматривали результаты утром, с появлением Ultrafast сокращается, что позволяет выполнять несколько итераций в течение рабочего дня.

Прорыв режима Ultrafast заключается в преодолении узкого места, связанного с пропускной способностью памяти традиционных GPU-кластеров на этапе декодирования вывода больших моделей, и в значительной степени опирается на аппаратную архитектуру Cerebras на уровне целой пластины (wafer).

Среди производителей ИИ-чипов решение Cerebras уникально: их поколения чипов изготавливаются из целой кремниевой пластины, интегрируя на одном кристалле огромное количество вычислительных ядер и сверхбыструю внутреннюю сеть.

Традиционным GPU при выполнении авторегрессионного декодирования и генерации токенов большой моделью, ограниченные пропускной способностью видеопамяти, необходимо постоянно перемещать огромные веса модели между внешней памятью HBM и вычислительными ядрами; кроме того, разделение на несколько карт приводит к задержкам межчиповой связи (PCIe/NVLink).

В то время как каждый кристалл Cerebras последнего поколения на целой пластине (WSE-3) содержит 4 триллиона транзисторов, обеспечивает 125 петафлопс ИИ-вычислений и имеет до 44 ГБ сверхбыстрой оперативной памяти SRAM на кристалле. Параметры модели полностью постоянно находятся в этой SRAM с очень высокой пропускной способностью, что исключает время ожидания из-за многократной загрузки весов из внешней памяти.

Конечно, полное количество параметров GPT-5.6 Sol как передовой флагманской модели явно превышает ёмкость одного чипа. У Cerebras также есть механизм «конвейерного параллелизма по нескольким пластинам» (Pipelined across wafers), при котором различные слои модели распределяются по нескольким пластинам, параметры каждого слоя постоянно находятся в SRAM своего чипа, что позволяет токенам передаваться между пластинами практически без задержек.

Для многих пользователей больших моделей 14-кратное ускорение флагманской модели означает, что задачи, которые раньше требовали переключения на менее мощные модели (например, Luna и Terra), теперь можно уверенно выполнять на полной мощности. Для задач, связанных с агентами, требующих множественных вызовов инструментов, генерации и отладки кода, сложных цепочек рассуждений, процессы, занимавшие несколько часов, можно сжать до нескольких минут.

Более высокая скорость, возможно, означает и изменение способов использования ИИ:

В сообществе ИИ уже ждут ультрабыстрые версии моделей Luna и Terra, только неизвестно, хватит ли чипов Cerebras.

Ссылки:

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Эта статья взята из официального аккаунта WeChat «Машина, которая почти человек» (ID: almosthuman2014), автор: Машина, которая почти человек, следящая за большими моделями.

Трендовые криптовалюты

Связанные с этим вопросы

QКак называется новый режим работы модели GPT-5.6 Sol от OpenAI и насколько он увеличил скорость?

AНовый режим называется 'Ultrafast Mode' (Сверхбыстрый режим). Он увеличил скорость вывода GPT-5.6 Sol до 750 токенов в секунду, что в 14 раз быстрее базового стандартного режима (около 53 токенов/с).

QКакое партнерство позволило OpenAI достичь такого ускорения GPT-5.6 Sol и какая технология была ключевой?

AУскорение было достигнуто благодаря партнерству с производителем чипов для ИИ Cerebras. Ключевой технологией является их уникальная архитектура на уровне пластины (wafer-scale), в частности, чип WSE-3. Он позволяет хранить все параметры модели в сверхбыстрой SRAM на кристалле, избегая узких мест, связанных с пропускной способностью памяти традиционных GPU.

QКак модель GPT-5.6 Sol в режиме Ultrafast показала себя на тесте 'Humanity's Last Exam' (HLE) по сравнению с конкурентами?

AВ режиме Ultrafast модель GPT-5.6 Sol завершила тест из 2500 сложных вопросов 'Humanity's Last Exam' за 11 часов 11 минут. Это примерно в 7 раз быстрее, чем модели Claude Fable 5, которой потребовалось 78 часов 27 минут, при сопоставимой точности.

QКакие практические сценарии использования нового быстрого режима GPT-5.6 Sol приводит OpenAI?

AOpenAI приводит несколько примеров, включая: реагирование на инциденты и анализ логов в реальном времени; финансовые исследования и безопасность для быстрой оценки рынка; поддержку клиентов для решения сложных вопросов без задержек; помощь в покупках для предотвращения отказа от корзины; интерактивные исследования и эксперименты, позволяющие проводить множество итераций в течение рабочего дня.

QЧем архитектура чипа Cerebras WSE-3 принципиально отличается от традиционных GPU для выполнения больших языковых моделей?

AChip Cerebras WSE-3 изготавливается из целой кремниевой пластины, содержит 4 триллиона транзисторов и 44 ГБ сверхбыстрой SRAM прямо на кристалле. Это позволяет хранить все параметры модели в памяти с высокой пропускной способностью на чипе, исключая необходимость постоянной перезагрузки весов из внешней памяти (HBM), что является основным узким местом в традиционных GPU-кластерах.

Похожее

После токенизации казначейских облигаций США токенизация акций становится новой ареной битвы в сфере RWA

**Токенизированные акции: новая арена RWA** В то время как рынок токенизированных гособлигаций США замедлил рост, сегмент токенизированных акций демонстрирует быстрое расширение, достигнув примерно $1,9 млрд. SEC выделяет четыре основные модели токенизации ценных бумаг: спонсируемые эмитентом, кастодиальные, синтетические привязанные ценные бумаги и свопы на ценные бумаги. Ключевые игроки применяют разные стратегии: * **Securitize** использует модель прямого токенизации от эмитента, обеспечивая полные права акционера, но с более строгими требованиями соответствия. * **Ondo и xStocks** выпускают токенизированные долговые ценные бумаги, обеспеченные акциями, что обеспечивает большую гибкость и доступность в экосистеме DeFi, но может приводить к фрагментации ликвидности. * **Robinhood** перешёл от структуры свопа к модели, аналогичной Ondo, и запустил собственную блокчейн-сеть Robinhood Chain. * **Традиционная инфраструктура** (DTCC, NYSE, Nasdaq) активно тестирует и внедряет решения для токенизации с целью повышения эффективности и ликвидности. * **Coinbase** анонсировала скорый запуск токенизированных акций, обещая права акционеров и использование в блокчейне, но, вероятно, с ограничениями для клиентов США. Различные игроки, от Web3-нативных платформ до традиционных финансовых институтов, конкурируют на этом новом поле, стремясь к цели — сделать торговлю любыми активами более доступной и эффективной. Ключевыми факторами будущего роста станут развитие регуляторных рамок и способность токенизированных акций стать следующим катализатором для всего сектора RWA.

marsbit45 мин. назад

После токенизации казначейских облигаций США токенизация акций становится новой ареной битвы в сфере RWA

marsbit45 мин. назад

Что учуяли частные фонды, коллективно сокращая позиции в NVIDIA?

Во втором квартале несколько крупных хедж-фондов, включая GaoYi Capital, синхронно сократили свои позиции в акциях NVIDIA. GaoYi уменьшила долю более чем на 70%, а Jinglin Capital полностью распродала свои активы. Вместо этого фонды увеличили инвестиции в компании, занимающиеся полупроводниковым производством и производством памяти. GaoYi Capital сделала тайваньскую компанию TSMC своим крупнейшим активом, увеличив долю до 24% от общего портфеля. Фонд также значительно нарастил позиции в Micron и SanDisk. Аналогичные операции с акциями компаний памяти провел и фонд Orient Harbor. Аналитики указывают, что это не означает отрицания тренда развития ИИ, а отражает смену инвестиционной логики: от движимой ожиданиями к движимой фактическими результатами. Рынок теперь больше фокусируется на реальных заказах, выпуске продукции и денежных потоках компаний. TSMC рассматривается как ключевое «узкое место» в цепочке поставок ИИ благодаря своему доминированию в передовом производственном процессе и мощностях передовой упаковки CoWoS. Компания занимает уникальное положение, так как практически все ведущие ИИ-чипы производятся на ее мощностях. Сектор памяти, в частности HBM (высокоскоростная память), стал вторым ключевым «узким местом» из-за взрывного роста спроса со стороны ИИ. Это придает ему двойные характеристики: циклические и связанные с ростом. Сокращение позиций в NVIDIA объясняется сужением ожиданий и высокой оценкой, которая уже учитывает много оптимистичных прогнозов. Инвесторы перераспределяют капитал в сторону активов с более привлекательным соотношением риск/доходность, таких как TSMC и компании памяти, где потенциальная доходность считается выше. Таким образом, основная логика перестановок заключается в миграции прибыли внутри ИИ-индустрии: от этапа проектирования чипов к этапам производства и поставок критических компонентов, где существуют физические ограничения по мощности.

marsbit1 ч. назад

Что учуяли частные фонды, коллективно сокращая позиции в NVIDIA?

marsbit1 ч. назад

Обратный тест Тьюринга: этот «большая языковая модель, созданная вручную», свел пользователей сети с ума

Обратный тест Тьюринга: «Большая языковая модель ручной работы», которая довела пользователей до истощения. Недавно в Сан-Франциско появился рекламный щит, продвигающий «новую большую языковую модель» ChatTJB. Однако оказалось, что это не ИИ, а «искусственный интеллект вручную», созданный реальным человеком по имени Такер. Он лично читает вопросы, обдумывает ответы и отвечает каждому пользователю, имитируя работу ИИ. Проект, изначально задуманный как художественная сатира, быстро набрал популярность, и Такер стал получать тысячи сообщений ежедневно. Из-за нагрузки доступ для новых пользователей временно приостановлен. ChatTJB высмеивает современные тенденции в области ИИ, используя такие термины, как «человеческий слой рассуждений» и «детерминированная кривая задержки». Также была добавлена шуточная опция Pro-подписки для «помощи в оплате рекламного щита». Интересно, что многие пользователи, начавшие общение ради шутки, постепенно стали делиться с Такером личными переживаниями, ценя живое человеческое внимание. Аналогичный проект — Your AI Slop Bores Me — позволяет пользователям либо отправлять запросы, либо выступать в роли «ИИ», отвечая другим. Все ответы и рисунки создаются людьми, что часто приводит к забавным и неожиданным результатам. Оба проекта напоминают о ценности человеческого взаимодействия в эпоху автоматизации.

marsbit1 ч. назад

Обратный тест Тьюринга: этот «большая языковая модель, созданная вручную», свел пользователей сети с ума

marsbit1 ч. назад

Только что DeepSeek Harness произвел фурор с открытым исходным кодом: Всё — плагин

Только что DeepSeek представил открытый фреймворк DeepSeek Harness (предварительная версия для разработчиков). Это не просто новый клиент API, а полноценный SDK и фреймворк для создания, запуска и расширения агентов ИИ. Ключевой принцип — «всё является плагином», включая сам цикл работы агента. Фреймворк построен на базе микроконцепции Cordis и отличается модульной архитектурой, состоящей из более чем 230 пакетов. Это позволяет гибко собирать агента с нужными возможностями (работа с файлами, терминалом, веб-поиском, подпроцессами, языковыми серверами и т.д.) через конфигурационный файл `cordis.yml`. DeepSeek Harness обеспечивает детальное управление жизненным циклом агента, включая вызов инструментов, параллельное выполнение, обработку прерываний и внедрение новых инструкций пользователя. Все события (запросы модели, результаты работы инструментов) фиксируются в «Журнале сессии» (Session Log), который является единым источником истины для восстановления состояния, отладки и аудита. Фреймворк поддерживает многозадачность через создание дочерних агентов и рабочих процессов (workflow). Пользователям доступны несколько интерфейсов: Web UI с разными пресетами (Стандартный, PTC, Минималистичный, Творческий), TUI для терминала и headless-режим для автоматизации. Особенность «Творческого режима» — возможность для агента исследовать и модифицировать собственную среду выполнения через плагины. Безопасность является системным приоритетом. По умолчанию действует политика ограничения доступа к рабочей области (workspace-write), а операции за её пределами требуют явного разрешения пользователя. Все решения о безопасности регистрируются в журнале. Таким образом, DeepSeek Harness позиционируется не как очередной «помощник по программированию», а как фундаментальная, расширяемая и безопасная инфраструктура для сборки агентов, где модель ИИ является лишь одним из подключаемых компонентов.

marsbit1 ч. назад

Только что DeepSeek Harness произвел фурор с открытым исходным кодом: Всё — плагин

marsbit1 ч. назад

Черный кит выходит из воды, начинается вторая половина DeepSeek

DeepSeek 13 августа представил два важных обновления: официальный релиз модели V4 Pro и выпуск превью-версии Harness — системы исполнения для AI-агентов с открытым исходным кодом (лицензия MIT). Основное внимание уделяется Harness, архитектура которого построена по принципу «всё — это плагин». Это позволяет разработчикам гибко настраивать все компоненты агента (модель, инструменты, интерфейс, стратегию выполнения) без изменения исходного кода системы. Ключевые особенности: полная追溯ваемость логов, стабильность выполнения длинных задач и поддержка множества моделей, включая сторонние (Kimi, OpenAI и др.). Релиз знаменует стратегический сдвиг DeepSeek от простой продажи вычислительных ресурсов (токенов) к поставке готовых решений. Harness призван повысить эффективность и снизить стоимость выполнения сложных задач (например, программирования), где система исполнения не менее важна, чем сама модель. Хотя проект находится на ранней стадии (v0.1), его открытость и модульность дают сообществу возможность определять будущее AI-агентов.

marsbit1 ч. назад

Черный кит выходит из воды, начинается вторая половина DeepSeek

marsbit1 ч. назад

Торговля

Спот

Популярные статьи

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на SOL (SOL) представлены ниже.

活动图片