
Базовая модель Luna упала в цене кратно. Цена за миллион токенов на вход снизилась с 1 доллара до 0,2 доллара, на выход — с 6 долларов до 1,2 доллара.
В пересчете на юани это примерно 6,8 юаня до 1,35 юаня за вход и 40,6 юаня до 8,1 юаня за выход.
Модель Terra, позиционируемая как «основной рабочий инструмент на каждый день», также подешевела на 20%, цены на вход и выход снизились до 2 и 12 долларов соответственно.
В пересчете на юани это примерно 13,5 и 81,2 юаня.
Только флагманская модель Sol осталась по прежней цене, но для нее представили Fast mode, скорость в котором может достигать 2,5 раз от стандартного режима, ускорение без доплаты.

После того как Codex решительно обнулил квоты, сразу же подоспело и снижение цен. OpenAI, ты кого собрался задавить конкуренцией?...
Ценовая война перешла в стадию белого каления.
OpenAI заявляет, что снижение цен стало возможным потому, что GPT-5.6 Sol сам помог себе сэкономить.
GPT-5.6 Sol участвовал в собственном улучшении, эффективность совершила скачкообразный рост, поэтому мы специально дарим это пользователям, новым и старым~
Технику «левая нога на правую — и взлететь на месте», OpenAI, ты тоже освоил.

。
Две модели подешевели, одна ускорилась
На данный момент API-цены трех моделей GPT-5.6 выглядят так:
GPT-5.6 Luna: за миллион токенов вход 0,2 доллара, выход 1,2 доллара;
GPT-5.6 Terra: за миллион токенов вход 2 доллара, выход 12 долларов;
GPT-5.6 Sol: за миллион токенов вход 5 долларов, выход 30 долларов.

После снижения цен Luna совершила настоящий нырок.
Ее цена на вход сравнялась с ценой на вход предыдущего поколения GPT-5.4 nano, а цена на выход даже на 0,05 доллара дешевле.
Но задачи у двух моделей не полностью идентичны. GPT-5.4 nano в основном ориентирована на простые и частые задачи, такие как классификация, извлечение информации и ранжирование.
GPT-5.6 Luna же позиционируется OpenAI как модель для рабочих нагрузок, чувствительных к стоимости, которая может вызывать инструменты, обрабатывать длинный контекст и выполнять многошаговые рабочие процессы.
Проще говоря, OpenAI начинает продавать модель, которая поддерживает работу агентов, по ценам прошлых простых маленьких моделей.
Terra была относительно сдержанной, подешевев на 20%.
Sol сохранила прежнюю цену, но добавился Fast mode, скорость в котором может достигать 2,5 раз от стандартного режима, а цена в два раза выше, чем у стандартного режима, при неизменном уровне интеллекта модели.
Он также заменит предыдущий Priority Processing. API-запросы, использовавшие тег priority, могут автоматически переключаться в Fast mode.
По заявлению компании, эти изменения также будут внедрены в Codex и ChatGPT Work.
Стоимость подписки не снизится, общий объем квот пользователей тоже не увеличится, но при вызовах Terra и Luna расход квот будет соответственно уменьшен.
За ту же плату за подписку модель сможет выполнить работу несколько раз.
OpenAI также заодно заменил модель Auto-review в ChatGPT и Codex CLI с GPT-5.4 на GPT-5.6 Luna.
Auto-review отвечает за фоновую проверку кода и результатов изменений, что является типичной задачей для частого использования агентами.
Совмещая обновление модели и снижение цены на Luna, OpenAI ожидает, что ее стоимость снизится примерно до одной десятой от первоначальной.
Дешевые модели больше не отвечают только за традиционную «черновую работу», такую как классификация и извлечение, а начинают проникать в такие сферы, как проверка кода, фоновый мониторинг, требующие принятия решений и вызова инструментов.
На данный момент позиционирование трех моделей следующее:
Задачи с ограниченным бюджетом и большим объемом вызовов поручайте Luna;
Обычную повседневную работу поручайте Terra;
Сложные задачи продолжайте выполнять с помощью Sol;
Если даже ожидание кажется слишком медленным, заплатите вдвое больше за скорость.
GPT-5.6 начал участвовать в снижении собственных затрат
Почему вдруг снизили цены?
OpenAI заявляет, что причина в том, что GPT-5.6 Sol участвовал в оптимизации собственной производственной системы.
Повышенная им эффективность впоследствии превратилась в цифры скидок в прайс-листе.
Конкретно, GPT-5.6 Sol переписал и оптимизировал часть GPU Kernel в производственной среде, спроектировал и провел сотни экспериментов по генерации токенов, а также участвовал в мониторинге обучения, вмешиваясь при возникновении проблем.
Итоговые результаты также впечатляют: оптимизация производственного GPU Kernel позволила снизить стоимость сквозного обслуживания GPT-5.6 на 20%; улучшение спекулятивного декодирования повысило эффективность генерации токенов более чем на 15%.

GPU Kernel можно понимать как низкоуровневые программы, выполняющие конкретные вычислительные задачи модели на GPU.
Сама модель меняться не должна, достаточно, чтобы эти программы были написаны более эффективно — тогда тот же GPU сможет быстрее выполнять вычисления, обрабатывать больше запросов, и стоимость единичного вызова также снизится.
Спекулятивное декодирование — это, при генерации ответа, сначала «угадать» пакетом, какие токены могут появиться дальше, а затем передать их основной модели для проверки. Чем точнее угадывание, тем меньше шагов, требующих пошаговой генерации и ожидания.
Обе оптимизации не снижают возможности модели, но позволяют той же модели работать быстрее и дешевле.
Однако это еще не полное автономное самообновление GPT-5.6.
OpenAI специально подчеркивает, что весь процесс по-прежнему контролируется человеком.
Модель может писать код, проводить эксперименты, отслеживать аномалии, но определение целей, принятие решения о пригодности результатов, внедрение ли кода в производственную среду — все это по-прежнему требует «Человека в цикле».
OMT
Наконец, есть еще одно новое изменение.
У этого снижения цен есть очень конкретная точка приложения: Рабочие процессы агентов (Agent workflows).
Сильнее всего подешевевшая Luna — это не просто традиционная маленькая модель для классификации и извлечения.
Согласно позиционированию OpenAI, она может вызывать инструменты, выполнять многошаговые задачи и в основном ориентирована на частые, чувствительные к стоимости рабочие нагрузки.
Таким образом, снижение цены на Luna на 80% также снижает порог для долгосрочной работы агентов.
Задачи проверки, валидации и мониторинга, которые ранее не могли выполняться часто из-за высокой стоимости, получают шанс стать регулярными шагами в рабочих процессах.
В сочетании с участием GPT-5.6 в оптимизации собственной производственной системы появляется новый цикл:
Модель участвует в повышении эффективности работы, затраты снижаются; после снижения цен модель проникает в большее количество частых рабочих процессов; масштаб вызовов расширяется, что, в свою очередь, стимулирует следующий раунд оптимизации эффективности.
Маховик снижения цен от OpenAI уже обретает очертания.
После всех этих операций давление напрямую переходит к A-компании:
«Теперь твоя очередь.»

Ссылки:[1]https://x.com/OpenAI/status/2082878156483219672[2]https://x.com/sama/status/2082880720989532597
Эта статья из официального аккаунта WeChat «Квантовый бит», автор: Следим за передовыми технологиями







