Проснувшись, обнаруживаешь, что новости о OpenAI просто повсюду.
Сначала пользователь X Leo@synthwavedd эксклюзивно заявил: OpenAI завершила новое предварительное обучение, кодовое название «Bel», масштаб параметров, как сообщается, превышает 10 триллионов, возможно, является преемником Doug и может стать базовой моделью для Astra / GPT-6...

После круга поисков выяснилось, что точных новостей нет. Но неоспоримым является то, что первый собственный логический чип OpenAI показал результаты.
Только что OpenAI опубликовала последние результаты тестов своего первого собственного логического чипа Jalapeño: достигнут значительный прорыв, этот чип специально разработан для логического вывода больших языковых моделей. Благодаря новой архитектурной разработке он может одновременно повысить пропускную способность и снизить задержку, сохраняя высокую энергоэффективность и достигая обоих преимуществ. В тестах с несколькими моделями он превзошел показатели эффективности систем NVIDIA GB200 и GB300.

Сразу же генеральный директор OpenAI Сэм Альтман также написал в X: «Мы создали чип, и он очень быстрый.»

Важно отметить, что как первый собственный логический чип OpenAI, Jalapeño не предназначен для обучения следующего поколения моделей GPT, а оптимизирован для этапа работы модели после её запуска.
Проще говоря: этап обучения — это когда модель приобретает способности, а этап логического вывода — это когда модель быстро отвечает на запросы пользователей. Jalapeño в основном решает вторую проблему.
OpenAI заявляет, что традиционные аппаратные системы часто вынуждены идти на компромисс между двумя показателями:
- Более высокая пропускная способность (throughput): обработка большего количества запросов за единицу времени;
- Более низкая задержка (latency): более быстрый отклик для пользователя.
Например, крупномасштабная пакетная обработка может повысить общую эффективность, но может увеличить время ожидания для единичного запроса; а стремление к сверхнизкой задержке может привести к снижению использования ресурсов. Цель Jalapeño — одновременно оптимизировать оба параметра в одной архитектуре.
Что касается конкретной производительности, OpenAI сообщает, что в тестах логического вывода с несколькими большими моделями Jalapeño превосходит системы NVIDIA GB200 и GB300. Среди тестируемых моделей: OpenAI GPT-OSS 120B; DeepSeek R1 670B; Moonshot AI Kimi K2.5 1T.

Особенно примечательно появление DeepSeek R1 и Kimi K2.5, что, по-видимому, говорит о том, что Jalapeño оптимизирован не только под собственные модели OpenAI, но и способен адаптироваться к различным рабочим нагрузкам больших моделей.
Интересно, что Jalapeño можно перевести как «Мексиканский перец чили», и после публикации этой новости она сразу же вызвала шутки и горячие обсуждения среди пользователей сети.
«Вы собираетесь назвать свой чип в честь перца? Не могу дождаться, чтобы попробовать.»

Для OpenAI запуск Jalapeño свидетельствует о том, что компания пытается выстроить целостную цепочку «модель — программное обеспечение — чип — центр обработки данных».
Кроме того, стоит отметить, что в разработке чипа Jalapeño от OpenAI в аппаратной части сотрудничали с Cerebras.
Тибо написал: «Эта возможность стала возможной благодаря нашему глубокому сотрудничеству с Cerebras и их уникальной аппаратной архитектуре. В будущем это сотрудничество продолжит расширять границы «сверхбыстрого» взаимодействия. Я с большим нетерпением жду продолжения сотрудничества, чтобы постоянно расширять границы на платформе Cerebras, исследовать, как запускать наши самые мощные модели с максимальной скоростью, и предлагать такой опыт самым требовательным к производительности клиентам.»

На самом деле, OpenAI — не первая компания в области ИИ, которая пошла по пути разработки собственных чипов. Ранее многие крупные игроки в сфере ИИ также уже начали создавать свои чипы. Например, Google выпустила TPU; Amazon разработала Trainium и Inferentia; Microsoft продвигает Maia; Meta также разрабатывает собственный ускоритель ИИ...
Логика, стоящая за этим, очень похожа: универсальные GPU достаточно гибки, но не оптимизированы для всех рабочих нагрузок ИИ. Для компаний, которые ежедневно обрабатывают огромное количество запросов ИИ, если они могут разрабатывать чипы, учитывая свои собственные модели, программные системы и способы предоставления услуг, появляется возможность дальнейшего снижения затрат...
Давайте подробнее рассмотрим возможности Jalapeño.
Быстрее, энергоэффективнее
Ключевое преимущество Jalapeño заключается в выполнении большего объема работы ИИ при том же энергопотреблении и одновременном возврате ответов с большей скоростью. Существующие системы обычно требуют компромисса между пропускной способностью и задержкой, в то время как Jalapeño пытается с помощью одной архитектуры одновременно достичь более высокой пропускной способности и более низкой задержки.
OpenAI подчеркивает, что это преимущество проявляется не только на собственных моделях, но и распространяется на модели, разработанные сторонними компаниями, что доказывает, что Jalapeño является более универсальной архитектурой для логического вывода.
На трех открытых моделях GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T, Jalapeño при пиковой пропускной способности достиг в 1.5~1.9 раза больше объема работы ИИ на ватт, а сквозная задержка снизилась до 1/1.7~1/3.6 от показателей сравниваемых систем; для высокоинтерактивных рабочих нагрузок преимущество в производительности составило от 2.1 до 4.1 раза.

На моделях GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T пиковая пропускная способность на ватт у Jalapeño достигла соответственно 1.9, 1.7 и 1.5 раза по сравнению с лучшими существующими системами.
При этом на самой крупной модели Kimi K2.5 производительность Jalapeño на ватт при пиковой нагрузке улучшилась примерно в 1.5 раза, а сквозная задержка снизилась примерно в 3.4 раза.

На модели Kimi K2.5 1T, по мере увеличения скорости декодирования для одного пользователя, преимущество Jalapeño перед GB300 в пропускной способности на ватт расширилось с 1.5 раза при пиковой нагрузке до максимум 56.1 раза.
OpenAI сравнивала не только пиковую производительность одного чипа, но и уделяла больше внимания одному показателю: сколько полезной работы ИИ может быть выполнено на единицу электроэнергии при соблюдении требований к задержке для пользователей и интерактивных агентов.
Причина также связана с агентами. Агентам часто необходимо последовательно выполнять несколько шагов, и, казалось бы, небольшая задержка в одном запросе будет постоянно накапливаться в процессе выполнения всей задачи.
Именно здесь Jalapeño проявляет себя наиболее заметно в диапазоне низких задержек. Взяв в качестве примера DeepSeek R1, в условиях, соответствующих предыдущему лучшему показателю TBT сравниваемой системы, пропускная способность Jalapeño на киловатт достигла 12,258 mixed TPS/kW, по сравнению с 118 у GB300, разница составляет около 104.3 раза.

На модели DeepSeek R1 670B пиковая пропускная способность на ватт у Jalapeño примерно в 1.7 раза выше, чем у GB300; при одинаковой скорости декодирования преимущество расширяется до 104.3 раза.
OpenAI использовала открытый тест SemiAnalysis InferenceX для проведения испытаний и сравнения с ведущими коммерческими системами. От сценариев обслуживания с высокой пропускной способностью до высокоинтерактивных сценариев с низкой задержкой Jalapeño на трех открытых моделях продемонстрировала лучшее сочетание производительности на ватт и задержки, находясь на Парето-фронте (Pareto frontier).

На различных точках работы модели DeepSeek R1 670B Jalapeño формирует более оптимальное сочетание между пропускной способностью на ватт, скоростью взаимодействия и сквозной задержкой, находясь на Парето-фронте.
Номинальное энергопотребление Jalapeño составляет 700 Вт, однако в тестируемых рабочих нагрузках фактическое постоянное энергопотребление всегда оставалось на уровне 550 Вт или ниже.
Рожден для Агентов
Jalapeño с самого начала разрабатывался с учетом современных и будущих больших языковых моделей, особенно интерактивных агентов.
Разные этапы логического вывода LLM имеют разные узкие места: Prefill больше зависит от вычислительной мощности, Decode больше ограничен пропускной способностью памяти, а перемещение данных между ядрами и чипами также увеличивает задержку.
Поэтому OpenAI осуществляет совместное проектирование чипа, памяти, сети, программного обеспечения и систем на уровне стойки. Состояние модели, включая KV Cache, может быть явно размещено и по возможности оставаться локальным, что позволяет Jalapeño одновременно адаптироваться к Prefill и Decode и регулироваться в зависимости от изменений объема работы обоих.
OpenAI считает, что это именно та ключевая характеристика, которой обладают рабочие нагрузки агентов.
Интересно, что ИИ — это не только объект, которому должен служить Jalapeño, но и он непосредственно участвовал в разработке этого чипа.
Используя модели разных этапов, команде OpenAI потребовалось всего 9 месяцев от первоначального дизайна до Tape-out (финализации проекта для производства). Модели использовались для изучения различных реализаций, сокращения циклов проектирования, измерений и проверки, а также участвовали в оптимизации арифметических схем чипа.
Jalapeño также был разработан как четкая и предсказуемая цель программирования как для людей, так и для моделей. Используя Codex на основе GPT-Astra, команда всего за 2 месяца добилась высокопроизводительной работы трех открытых моделей с весом, которые изначально не входили в первоначальный производственный план для Jalapeño.
В некоторых модулях Attention и MoE модели GPT-OSS реализации, сгенерированные Codex, оказались даже в 1.5~1.8 раза быстрее, чем оригинальные версии, написанные вручную экспертами-людьми.
Развертывание к концу года, второе и третье поколение уже в пути
OpenAI планирует начать развертывание Jalapeño в своей собственной вычислительной инфраструктуре до конца 2026 года. В настоящее время команда все еще проводит производственную валидацию, дорабатывает программное обеспечение, готовится к крупномасштабной эксплуатации и продолжает проверять производительность на большем количестве моделей.
Разработка последующих продуктов уже начата, Gen 2 находится на стадии углубленной разработки, а Gen 3 уже начинает обретать форму.
OpenAI суммировала изменения в эффективности, принесенные Jalapeño, в три уровня: режим Ultra-fast может достигать эффективности, которая раньше была доступна только в режиме Fast; режим Fast может достигать эффективности, которая раньше была доступна только в режиме Batch; а сам режим Batch еще больше повышает эффективность.
Однако разработка собственных чипов не означает, что OpenAI готовится отказаться от NVIDIA.
OpenAI четко заявляет, что для удовлетворения растущих потребностей в ИИ требуется больше вычислительных мощностей из всех доступных источников, компания по-прежнему будет продолжать крупномасштабное развертывание ускорителей NVIDIA и других партнеров, одновременно охватывая рабочие нагрузки как для обучения, так и для логического вывода.
Что вы думаете? Добро пожаловать в комментарии для обсуждения!
Ссылки:
https://x.com/OpenAI/status/2092300846675505602
https://x.com/sama/status/2092339694210040187
https://openai.com/index/jalapeno-first-results/
https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/
Эта статья взята с официального аккаунта WeChat «Сердце машины» (ID: almosthuman2014), автор: Сердце машины, следящее за ИИ, редакторы: Шань Хуэй, Youli








