ИИ начал играть на информационном неравенстве?
14 августа в ранние часы OpenAI совместно с производителем AI-чипов Cerebras анонсировали предварительный просмотр нового сервисного уровня «Ультрабыстрый режим» (Ultrafast Mode) для своего флагманской модели GPT-5.6 Sol.
В этом режиме скорость вывода GPT-5.6 Sol может достигать 750 токенов/с, что по сравнению с базовой скоростью вывода в стандартном режиме (Standard) около 53 токенов/с, означает ускорение до 14 раз без потери качества. В поперечном сравнении, ускоренный GPT-5.6 Sol в 11 раз быстрее Fable 5 и в 5 раз быстрее Opus 4.8 в быстром режиме (Fast).
Ultrafast Mode будет сначала внедрён в OpenAI API, а в настоящее время уже доступен ограниченный предварительный просмотр для некоторых клиентов.

Для этого OpenAI и Cerebras также представили таблицу, сравнивающую текущую скорость и интеллект современных больших языковых моделей, где GPT-5.6 Sol Ultrafast занимает абсолютно лидирующую позицию:

В блоге Cerebras инженеры описали тесты, проведённые на «Последнем экзамене человечества» (Humanity's Last Exam, HLE), где они сравнили модель в Ultrafast-режиме с прямыми конкурентами. Как известно, HLE — это сложный бенчмарк для моделей, содержащий 2500 вопросов, на которые обычно способны ответить только доктора наук в таких областях, как химия, экономика и литература.
GPT-5.6 Sol в ультрабыстром режиме ответил на все вопросы всего за 11 часов 11 минут. В то время как Claude Fable 5 потребовалось 78 часов 27 минут, то есть более трёх дней непрерывных вычислений для получения тех же выводов. Сопоставимая точность при почти 7-кратном преимуществе в скорости — ультрабыстрый режим GPT выполнил задания на переднем крае человеческих знаний всего за один рабочий день.

По мере роста возможностей моделей расширяется и область применения быстрого вывода. GPT-5.6 Sol — лучшая модель OpenAI на сегодняшний день в работе с юридическими документами, финансовыми моделями и инженерными отчётами. На бенчмарке GDP-Val (измеряющем экономически ценную интеллектуальную работу) Ultrafast обеспечил сквозное ускорение в 5,6 раза без ущерба для качества, что наглядно демонстрирует, как более высокая скорость вывода может ускорить выполнение экономически значимых задач.

Более быстрая обработка ИИ открывает новые возможности для рабочих процессов, позволяя теперь развертывать агентов на критических участках решения проблем. OpenAI приводит несколько примеров применения:
- Реагирование на инциденты и надёжность: при сбое критической системы ИИ анализирует журналы приложений, последние изменения кода и отчёты инженеров, чтобы определить возможные причины и помочь подготовить исправления, пока инцидент ещё продолжается.
- Финансовые исследования и безопасность: анализ рыночных сигналов, оценка сделок и выявление подозрительной активности в условиях быстро меняющейся рыночной ситуации.
- Поддержка клиентов и голосовые интерфейсы: решение сложных вопросов клиентов в реальном времени, даже если для поиска ответа требуется несколько шагов или систем, без прерывания диалога.
- Электронная коммерция: ответы на вопросы о продуктах, проверка наличия, персонализированные рекомендации и решение проблем при оформлении заказа, пока покупатель ещё колеблется, предотвращая превращение нерешительности в отказ от корзины.
- Исследования и эксперименты в реальном времени: превращение исследований, которые раньше требовали ночи, в интерактивные рабочие сессии, позволяя командам проверять идеи, изучать результаты, корректировать подходы и проводить следующий эксперимент без нарушения рабочего процесса.
Внутри OpenAI разработчики протестировали GPT-5.6 Sol в ультрабыстром режиме, и реагирование на инциденты — один из примеров использования Ultrafast. При срабатывании оповещения инженерам необходимо быстро составить точную картину происходящего, пока системы и свидетельства ещё меняются. Благодаря интеллекту уровня Sol команды могут быстро считывать журналы, анализировать трассировки, обобщать диалоги, определять следующие шаги проверки и помогать в подготовке или проверке исправлений. Режим Ultrafast сокращает задержку между наблюдением сигнала, проверкой гипотез и выбором следующего действия, при этом суждение и развертывание остаются за инженером.
В области исследований команда OpenAI использует Ultrafast для быстрого поиска по базам знаний, запросов к данным, а также оперативного сбора, организации и обобщения информации из различных инструментов. Распространённый ранее исследовательский процесс, когда члены команды запускали пакет экспериментов ночью и просматривали результаты утром, с появлением Ultrafast сокращается, что позволяет выполнять несколько итераций в течение рабочего дня.
Прорыв режима Ultrafast заключается в преодолении узкого места, связанного с пропускной способностью памяти традиционных GPU-кластеров на этапе декодирования вывода больших моделей, и в значительной степени опирается на аппаратную архитектуру Cerebras на уровне целой пластины (wafer).

Среди производителей ИИ-чипов решение Cerebras уникально: их поколения чипов изготавливаются из целой кремниевой пластины, интегрируя на одном кристалле огромное количество вычислительных ядер и сверхбыструю внутреннюю сеть.
Традиционным GPU при выполнении авторегрессионного декодирования и генерации токенов большой моделью, ограниченные пропускной способностью видеопамяти, необходимо постоянно перемещать огромные веса модели между внешней памятью HBM и вычислительными ядрами; кроме того, разделение на несколько карт приводит к задержкам межчиповой связи (PCIe/NVLink).
В то время как каждый кристалл Cerebras последнего поколения на целой пластине (WSE-3) содержит 4 триллиона транзисторов, обеспечивает 125 петафлопс ИИ-вычислений и имеет до 44 ГБ сверхбыстрой оперативной памяти SRAM на кристалле. Параметры модели полностью постоянно находятся в этой SRAM с очень высокой пропускной способностью, что исключает время ожидания из-за многократной загрузки весов из внешней памяти.
Конечно, полное количество параметров GPT-5.6 Sol как передовой флагманской модели явно превышает ёмкость одного чипа. У Cerebras также есть механизм «конвейерного параллелизма по нескольким пластинам» (Pipelined across wafers), при котором различные слои модели распределяются по нескольким пластинам, параметры каждого слоя постоянно находятся в SRAM своего чипа, что позволяет токенам передаваться между пластинами практически без задержек.
Для многих пользователей больших моделей 14-кратное ускорение флагманской модели означает, что задачи, которые раньше требовали переключения на менее мощные модели (например, Luna и Terra), теперь можно уверенно выполнять на полной мощности. Для задач, связанных с агентами, требующих множественных вызовов инструментов, генерации и отладки кода, сложных цепочек рассуждений, процессы, занимавшие несколько часов, можно сжать до нескольких минут.
Более высокая скорость, возможно, означает и изменение способов использования ИИ:

В сообществе ИИ уже ждут ультрабыстрые версии моделей Luna и Terra, только неизвестно, хватит ли чипов Cerebras.
Ссылки:
https://openai.com/index/previewing-ultrafast/
https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
Эта статья взята из официального аккаунта WeChat «Машина, которая почти человек» (ID: almosthuman2014), автор: Машина, которая почти человек, следящая за большими моделями.








