Одна и та же модель, официальная цена снизилась лишь на 20%, а ваш счёт уменьшился на 80%.

24 августа OpenAI опубликовала результаты совместного с AWS тестирования:
В Terminal-Bench 2.1 стоимость успешного выполнения задачи в Kiro моделью GPT-5.6 Terra снизилась примерно на 82%.
Kiro — это платформа AWS для интеллектуальных агентов разработки ПО, охватывающая IDE, CLI и Web.
Три модели семейства GPT-5.6 — Sol, Terra, Luna — работали в ней уже более месяца.
Эти 82% — не официальное снижение цены.
Последний раз цена Terra корректировалась 30 июля — на 20%.

Объявление OpenAI о корректировке цен от 30 июля, Terra подешевела на 20%.
Цена за единицу снизилась лишь на 20%, а итоговый счёт сократился на 80%.
Именно то, откуда взялись сэкономленные 60 процентных пунктов разницы, и заслуживает нашего внимания.
GPT-5.6 появился в Kiro в июле этого года.
13-го числа AWS объявила о доступности GPT-5.6 Sol, Terra, Luna в Amazon Bedrock.
На следующий день Kiro в своём блоге анонсировала интеграцию трёх моделей в IDE, CLI и Web.

Это первые модели OpenAI в Kiro, как раз к первой годовщине публичной превью-версии Kiro.
Сначала модели выставили на полку, затем отправили работать, и спустя месяц OpenAI отчиталась:
Вместе настроив среду Kiro и модели OpenAI, компании добились снижения стоимости успешной задачи для Terra примерно на 82%.
Сэкономлены
деньги за хождение по кругу
После корректировки цен 30 июля Terra подешевела на 20%, но в тестах Kiro стоимость одной задачи снизилась на 82%.
Откуда взялись дополнительные сэкономленные 60%?
Направления поиска таковы:
Модель генерирует меньше токенов, уменьшилось количество вызовов инструментов, снизилось число неудачных попыток, повторных запусков и окольных путей.
Таким образом, сэкономлена не цена каждого вызова, а деньги за те вызовы, которые были бы потрачены впустую.
Логика проста: если ИИ-агент проваливает задачу, счёт всё равно выставляется. Если он выбирает неверный путь, трижды сбивается с курса и возвращается обратно, токены за всё это тоже учитываются.
Именно так деньги часто утекают в реальной разработке.
OpenAI в официальном блоге указала на ту же логику: эффективность складывается из трёх уровней:
Фреймворк агента, который формирует запрос и организует контекст; оркестрационная система, которая управляет запросами; и, наконец, сама модель, работающая на GPU.

OpenAI разбирает источники эффективности GPT-5.6: запрос идёт от фреймворка агента, управляется системой оркестрации и выполняется моделью на GPU — экономия на каждом уровне.
Экономить можно и за счёт разделения труда моделей.
OpenAI также приводила пример использования: в рабочем процессе кодирования можно сначала использовать Sol для прояснения задачи и составления плана, а затем переключиться на Luna для реализации уже определённых изменений, написания тестов и запуска оценок.
Один и тот же конвейер, на разных этапах — разный уровень интеллекта.
Модель — лишь половина счета
Смена фреймворка — новая цена
Terminal-Bench 2.1 — это не тест, где модель просто отвечает на вопросы.
Он помещает модель в терминальную среду, даёт ей расплывчатую цель, и она сама планирует путь, вызывает инструменты, пишет скрипты, обрабатывает ошибки, итеративно повторяет.
Поэтому полученный результат — это результат комбинации «агент + модель».

Публичный рейтинг Terminal-Bench 2.1, справа от точности добавлена стоимость. (Источник: Terminal-Bench)
Четыре строки в рейтинге лучше всего иллюстрируют это:
Claude Code с Fable 5, 83.8%, $552.67;
Codex с GPT-5.5, 83.1%, $2059.19;
Codex с GPT-5.6 Terra, 78.4%, $421.15;
Codex с GPT-5.6 Luna, 75.7%, $241.45.
Разница в результатах первых двух строк всего 0.7 процентных пункта, а разница в стоимости — почти в 4 раза.
Одна и та же модель, помещённая в разные фреймворки, с разными стратегиями организации контекста и работы с инструментами, даёт совершенно разную итоговую стоимость.
Согласно официальным данным Kiro, Terra набирает 77.4 балла в Coding Agent Index, что лишь чуть выше 77.2 балла у Claude Fable 5.
Её козырь не в баллах, а в цене, соответствующей этим баллам.
Усилия Kiro в рамках spec-driven подхода также сосредоточены здесь, основная идея одна: нельзя сразу начинать писать код.
Сначала расплывчатая цель пользователя разбивается на формальное техническое задание, технический дизайн и исполняемый список задач, и только потом передаётся модели.
Таким образом, модель получает на вход не туманную фразу, а чётко определённую работу.
Знакомые с агентами сразу поймут, что этот шаг экономит именно самую дорогую часть расходов.
Токены, потраченные моделью на уход в сторону, переделки, полный перезапуск, часто обходятся дороже, чем сама работа.
Kiro также оставляет два контрольных этапа в процессе: перед внесением реальных изменений в код останавливаться для проверки человеком; после завершения работы автоматически запускать тесты для проверки корректности.
Каждая предотвращённая этими этапами переделка экономит реальные деньги.
Территория Claude на платформе Amazon
GPT забрал половину
Год назад Kiro был всего лишь spec-driven IDE, и выбор моделей был территорией Anthropic.
Год спустя AWS на своей платформе для интеллектуальных агентов разработки разместила сразу три модели OpenAI.
Sol, Terra, Luna и Claude теперь стоят рядом в одном выпадающем меню — картина, которую год назад было трудно представить.
Хотя GPT-5.6 на этот раз «поселился всей семьёй», доступ не был «полностью открыт».
Три модели внедрялись постепенно, в экспериментальном режиме, для пользователей Pro, Pro+, Pro Max и Power, и только в двух регионах — Северная Вирджиния (США) и Франкфурт (Европа), с поддержкой кросс-региональных вычислений.
И ещё один момент, к которому многие не привыкли: эти модели в Kiro работают со скрытой цепочкой рассуждений (hidden chain-of-thought) — вы не видите шаги её рассуждений, только конечный результат.
Те, кто привык следить за пошаговыми рассуждениями агента, могут почувствовать, будто отдали работу в непрозрачный ящик.
Официальное объяснение: это ожидаемое поведение, не влияющее на качество вывода.
Три модели в Kiro имеют чёткое ценообразование.
На момент запуска 14 июля за ту же задачу списывалось: Sol — в 2.4 раза больше, Terra — в 1.2 раза больше, Luna — в 0.6 раза больше.
После снижения цен OpenAI 30 июля, на следующий день Kiro последовала их примеру: Luna снизилась с 0.6 до 0.1, Terra с 1.2 до 1.0, только Sol осталась без изменений.

Позиция AWS очевидна: платформа для разработки не может зависеть только от одной модели.
В одном и том же селекторе две передовые модели начинают теснить друг друга по цене.
Критерии оценки моделей также меняются: высокий балл больше не гарантирует победы, побеждает и тот, кто тратит меньше.
Для разработчиков выбор модели раньше сводился к вопросу «Сколько стоит миллион токенов у этой модели?», а теперь нужно спрашивать: «Сколько мне в итоге придётся заплатить, чтобы она завершила эту задачу?».
Ссылки:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
Эта статья из официального аккаунта WeChat «Синь Чжи Юань» (ID: AI_era), автор: ASI启示录, редактор: 元宇






