Срочно: Маск представляет самый мощный Grok 4.5, с ценой уровня Opus по огромной скидке

marsbitОпубликовано 2026-07-09Обновлено 2026-07-09

Введение

SpaceXAI представила флагманскую модель Grok 4.5, разработанную совместно с Cursor. Модель демонстрирует высокую производительность в тестах SWE Bench Pro (64,7%), Terminal Bench 2.1 (83,3%) и DeepSWE 1.0 (62,0%), сравнимую с такими моделями, как OpenAI GPT-5.5 и Opus 4.7/4.8. Её ключевыми преимуществами объявлены высокая скорость (80 TPS) и эффективность: при решении задач Grok 4.5 использует в 4,2 раза меньше токенов, чем Opus 4.8. Цена составляет $2 за 1 млн входных токенов и $6 за 1 млн выходных. Модель натренирована на огромном количестве высококачественных данных от Cursor, включающих реальные сценарии взаимодействия разработчиков. Маск пообещал, что следующая версия получит контекст до 1 млн токенов и выйдет уже в следующем месяце, ознаменовав новый качественный скачок.

Grok 4.5, наконец-то сдан!

Только что SpaceXAI Илона Маска шокирующе представила свой самый мощный флагманский модели Grok 4.5 в истории.

На этот раз SpaceXAI и Cursor объединили усилия.

На десятках тысяч гигантских систем GB300 они «выковали» этого производительного монстра, созданного специально для программирования и агентов.

Результаты впечатляют —

  • SWE Bench Pro: уверенно набирает 64.7%, напрямую противостоит и превосходит 64.3% у Opus 4.7;
  • Terminal Bench 2.1: мчится до 83.3%;
  • DeepSWE 1.0: стабильно стоит на 62.0%, решительно подавляя Opus 4.8.

Маск прямо заявил: «Grok 4.5 примерно соответствует Opus 4.7, но гораздо быстрее».

Совокупность возможностей, скорости и стоимости — вот в чем его конкурентоспособность. То есть, для работы он использует токены, которых у других лишь крохи.

Цена ввода для Grok 4.5 составляет $2/миллион токенов, вывода — $6/миллион токенов.

По сравнению с Opus 4.8, потребление токенов сократилось в 4.2 раза.

Десятки тысяч GB300 «выковали» модель уровня Opus

Grok 4.5 — это первый козырь SpaceXAI после выхода на биржу и первый результат их совместной работы с Cursor.

Итак, как же его тренировали?

Ответ: сверхмасштабное обучение на десятках тысяч графических процессоров Nvidia GB300. Но наращивание вычислительной мощности — это только пропуск на площадку.

Маск анонсирует: на следующей неделе контекст Grok 4.5 будет увеличен до 1 миллиона

Место, где SpaceXAI действительно упорно поработала, — это данные.

Они провели дьявольскую фильтрацию, удаление дубликатов и оценку качества огромного массива текстов, гарантируя, что каждая порция информации, подаваемая в модель, является профессиональным контентом с высокой информационной плотностью.

Затем они сосредоточили усилия по обучению с подкреплением на показателе, о котором редко говорят — «интеллект на токен» (per-token intelligence).

Присоединение Cursor стало ключевым элементом в этой системе.

Основой Grok 4.5 является V9 (1.5T). По официальной информации, при обучении в модель было загружено триллионы данных от Cursor.

Эти данные записывают, как реальные разработчики взаимодействуют с репозиториями кода, инструментами и агентами.

Это означает, что модель изучает не только «как выглядит код», но и «как люди и ИИ вместе пишут код».

А его тренировочный стек спроектирован для высокой асинхронности —

агенты могут работать непрерывно в течение нескольких часов, модель продолжает учиться, пока работает, а обучение на десятках тысяч GPU не прекращается ни на мгновение.

В результате модель не только решает задачи, но и способна справляться со сложными многошаговыми инженерными проектами в течение длительных, многочасовых заданий.

Достигает уровня GPT-5.5, приближается к Opus 4.8

Производительность Grok 4.5, полученная таким подходом к обучению, абсолютно выдерживает проверку.

Его результаты в ключевых инженерных бенчмарках можно охарактеризовать как «стабильные» — не самые сильные, но достаточно хорошие, чтобы войти в первую лигу.

На DeepSWE 1.0 он набрал 62.0%, обогнав Opus 4.8 (55.75%) и близко подобравшись к GPT-5.5 (64.31%);

На Terminal Bench 2.1 он взлетел до 83.3%, отстав от GPT-5.5 (83.4%) всего на 0.1!;

На более жестком SWE Bench Pro он с решением 64.7% обогнал GPT-5.5 (58.6%), приблизившись к Opus 4.8 (69.2%).

В официальном тесте AAAI Grok 4.5 занял четвертое место, уступив только Fable 5, GPT-5.5 и Opus 4.8.

В тесте Harvey на юридических агентах занял первое место.

Нельзя не сказать, что этот отчет о результатах очень сильный.

Но нужно признать, что на данный момент железный трон по-прежнему уверенно занимает Claude Fable.

В целом, Grok 4.5 и GPT-5.5 в основном находятся на одном уровне, близко к Opus 4.8, но до настоящего потолка еще есть расстояние.

Сам Маск говорит очень прагматично: «По нашей внутренней оценке, Grok 4.5 примерно соответствует Opus 4.7, но гораздо быстрее».

Настоящий козырь: быстрый и дешевый

Настоящий удар Grok 4.5 скрыт в трех словах: скорость, эффективность и цена.

Его скорость логического вывода достигает 80 TPS (токенов в секунду). Официальная формулировка: «быстрее, чем модели класса flash».

Всего одной фразой он написал симулятор 3D-солнечной системы на Three.js:

Поддержка ускорения времени, реалистичное орбитальное движение восьми планет, даже панель HUD сделана весьма искусно.

В плане эффективности, в задачах SWE Bench Pro, Grok 4.5 в среднем выдает всего 15 954 токена, чтобы решить проблему.

В то время как Opus 4.8 для той же работы в среднему должен выдать 67 020 токенов.

В 4.2 раза — Grok 4.5 использует менее четверти токенов соперника, чтобы выполнить ту же инженерную задачу.

В плане цены: ввод $2 за миллион токенов, вывод $6 за миллион токенов.

Кроме того, есть более быстрая расширенная версия с ценой ввода $4 / вывод $18.

По сравнению с множеством топовых моделей, которые стартуют от десятков долларов, эта цена практически доводит стоимость до минимума.

Совокупность этих трех цифр приводит к одному выводу:

В вопросе «сколько интеллекта можно купить за единицу времени и единицу стоимости» Grok 4.5 на данный момент является «королем соотношения цены и качества».

Тестирование в сети: реальные результаты Grok 4.5

Кроме того, из отзывов множества пользователей в сети можно увидеть проблеск реальных возможностей Grok 4.5.

Одной фразой — прямо генерирует «Майнкрафт».

В отдельном HTML-файле Grok 4.5 с легкостью справляется с созданием полноценной страницы для премиального SaaS-продукта.

Grok 4.5 проявляет себя во всей красе, завершая полный набор 2D+3D дизайнерских решений прямо в приложении менее чем за минуту.

Великий мастер игр на ИИ Danny Limanseta использовал Grok 4.5 для создания игры с полным набором функций.

Однако некоторые разработчики отмечают, что Grok 4.5 совершенно не находится на одном уровне с Opus 4.7, и тестовая генерация лавовой лампы получилась плохой.

Не самый сильный, но готовится перевернуть стол в следующем месяце

Сегодня Маск снова заложил мину:

Grok глубоко понимает инженерное дело.

Версия следующего месяца станет очередным скачком, потому что мы замыкаем петлю по решению реальных инженерных проблем в Tesla, SpaceX, Neuralink и Boring Company.

В следующем месяце — еще один скачок. И, по слухам, в разработке уже находится более крупная версия с 2 триллионами параметров.

Бенчмарки — это фейерверк для посторонних; эффективность и стоимость — вот реальное оружие для затяжной войны с противником.

Когда интеллект модели начинает измеряться, как электричество, победителем становится тот, кто может сделать интеллект быстрым, дешевым и повсеместным.

На этот раз Маск не разыграл самую сильную карту, но перевернул игровой стол.

Ссылки:

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

Эта статья из официального аккаунта WeChat «New Zhiyuan», автор: ASI启示录, редактор: Персик.

Связанные с этим вопросы

QКакие основные достижения демонстрирует модель Grok 4.5 в тестах на производительность, согласно статье?

AМодель Grok 4.5 показывает выдающиеся результаты в ключевых инженерных тестах: SWE Bench Pro — 64.7%, что превосходит GPT-5.5 (58.6%) и приближается к Opus 4.8 (69.2%); Terminal Bench 2.1 — 83.3% (почти на уровне GPT-5.5); DeepSWE 1.0 — 62.0%, что превосходит Opus 4.8 (55.75%). Кроме того, в официальном тесте AAAI она заняла четвёртое место, а в тесте Harvey для юридических агентов — первое.

QВ чём заключаются главные конкурентные преимущества Grok 4.5 по сравнению с моделями вроде Opus?

AГлавными преимуществами Grok 4.5 являются эффективность, скорость и цена. Модель потребляет значительно меньше токенов для решения задач (например, в 4.2 раза меньше, чем Opus 4.8 на SWE Bench Pro), обладает высокой скоростью вывода — 80 токенов в секунду, и предлагает низкую стоимость: 2 доллара за 1 млн входных токенов и 6 долларов за 1 млн выходных. Это делает её лидером по соотношению «интеллект за единицу времени и стоимости».

QКак происходило обучение модели Grok 4.5 и какая роль в этом была у Cursor?

AОбучение Grok 4.5 проводилось на тысячах графических процессоров Nvidia GB300 в рамках масштабного сотрудничества между SpaceXAI и Cursor. Ключевую роль сыграли уникальные данные от Cursor — триллионы записей о том, как реальные разработчики взаимодействуют с кодом и инструментами. Это позволило модели изучить не только синтаксис кода, но и рабочие процессы. Также был сделан акцент на обучении с подкреплением, чтобы повысить «интеллект на один токен» (per-token intelligence), а асинхронный тренировочный стек позволил модели обучаться во время выполнения длительных задач.

QЧто Илон Маск и SpaceXAI обещают в отношении будущих версий Grok?

AИлон Маск заявил, что уже в следующем месяце ожидается новая версия с «скачкообразным улучшением». Это произойдёт благодаря интеграции опыта решения реальных инженерных задач в таких компаниях, как Tesla, SpaceX, Neuralink и The Boring Company. Также в статье упоминается, что в разработке находится более крупная версия модели с 2 триллионами параметров.

QКакие примеры практического применения Grok 4.5 приводят пользователи в статье?

AВ статье приводятся примеры применения Grok 4.5 пользователями: создание 3D-симулятора Солнечной системы на Three.js по одному запросу, генерация полноценной страницы для SaaS-продукта в одном HTML-файле, создание игрового мира, похожего на «Minecraft», а также быстрое проектирование 2D+3D дизайна в приложении. Однако есть и критические отзывы, например, о неудовлетворительной генерации «лавовой лампы», где модель показала результат хуже, чем у конкурентов.

Похожее

Эстафета «спасения казначейских облигаций США»: Бесант на прошлой неделе провалился, на этой неделе смотрим на Уоша

Министр финансов США Бессент пытался стабилизировать рынок государственных облигаций, удвоив объемы выкупа долгосрочных казначейских облигаций, чтобы снизить растущую доходность на длинном конце кривой. Однако эффект был краткосрочным: доходности вскоре вернулись к высоким уровням, а рынок отреагировал ростом золота и биткоина, что аналитики расценивают как "клапан сброса давления". Теперь внимание обращено к председателю ФРС Уоршу, который выступит на симпозиуме в Джексон-Хоуле. Рынки ждут ясных сигналов о реакции ФРС на инфляцию, сохраняющуюся выше целевого уровня 2%, и ухудшающуюся фискальную динамику. Эксперты предупреждают, что повторение прежней риторики разочарует инвесторов и усилит продажи. Ключевым вопросом является то, сможет ли ФРС, в отличие от казначейства, эффективно заякорить инфляционные ожидания. Обсуждается возможность запуска ФРС аналога "Операции Твист" — продажи краткосрочных и покупки долгосрочных облигаций для снижения долгосрочных ставок без расширения баланса. Перед выступлением Уорша будет опубликован индекс PCE за июль, который может задать тон. Аналитики указывают на уровень доходности 30-летних облигаций в 5% как на критическую точку, преодоление которой усилит давление на доллар и рискованные активы, а также подчеркивают растущую конкуренцию за капитал со стороны корпоративных заимствований и снижение терпимости иностранных инвесторов.

marsbit21 мин. назад

Эстафета «спасения казначейских облигаций США»: Бесант на прошлой неделе провалился, на этой неделе смотрим на Уоша

marsbit21 мин. назад

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

Гиперликвидный, первоначально функционировавший как децентрализованная платформа для торговли перпетуальными контрактами без разрешений, сталкивается с ключевыми регуляторными препятствиями для выхода на рынок США. Американское законодательство о структуре рынка, требующее регистрации торговых площадок (DCM), клиринговых палат (DCO) и брокеров (FCM), конфликтует с его безотзывной, самохраняемой и глобально доступной инфраструктурой на блокчейне. В ответ Гиперликвидный основал Политический центр (HPC) для лоббирования модернизации правил CFTC и SEC, предлагая рассматривать его слой HyperCore как нейтральную инфраструктуру, которую лицензированные организации могут использовать при соблюдении своих обязанностей (KYC, надзор за рынком). В качестве практического шага к соблюдению требований на тестовой сети был представлен HIP-3 с функцией управления разрешениями. Такие развертывания позволяют регулируемым организациям создавать рынки с белыми списками пользователей, сохраняя при этом контроль. Несмотря на отдельные ордербуки, общая ликвидность и залоговое обеспечение на одном L1 позволяют избежать фрагментации. Этот путь, поддержанный недавними политическими заявлениями, направлен на предоставление американским инвесторам регулируемого доступа к рынкам Гиперликвидного, в то время как его основные рынки остаются открытыми и без разрешений.

marsbit45 мин. назад

Путь Hyperliquid к соответствию: от неограниченного доступа к разрешительной системе HIP-3

marsbit45 мин. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

В статье поднимается ключевой вопрос политической экономии эпохи ИИ: по мере того, как роботы и ИИ становятся все более способными, как человечество будет делиться создаваемой ими стоимостью? В отличие от предыдущих промышленных революций, ИИ впервые заменяет не только физический, но и когнитивный труд, что подрывает традиционную связь между ростом производительности, занятостью и доходами. В мире наблюдается парадокс: технологические гиганты создают огромные богатства (капитализация топ-10 компаний превышает $20 трлн), в то время как доля трудовых доходов в ВВП снижается. Это создает фундаментальное противоречие: производственные возможности растут, но потребительский спрос может отставать из-за проблем с распределением доходов. Автор рассматривает три возможных пути распределения благ в эпоху ИИ: 1) традиционный капитализм (прибыль — акционерам, перераспределение через налоги); 2) государственный капитализм (участие государства в активах ИИ); 3) инновационные механизмы, такие как цифровые суверенные фонды, всеобщее акционерное владение или базовый доход, позволяющие напрямую делиться плодами ИИ со всем обществом. Для Китая, как и для других стран, главный вызов заключается не в замедлении технологического прогресса, а в создании эффективного механизма трансформации производительности ИИ в рост доходов населения, потребления и социального обеспечения. Будущая конкуренция будет определяться не только технологическим превосходством, но и способностью построить новую, справедливую систему распределения, которая обеспечит широкое социальное благосостояние в интеллектуальную эпоху.

marsbit1 ч. назад

Самый важный вопрос политической экономии в эпоху ИИ: как люди будут разделять ценность, когда роботы становятся все более способными?

marsbit1 ч. назад

Получение прибыли в течение 7 кварталов подряд: арбитражные сделки на развивающихся рынках превосходят все

Прибыльная торговля на разнице процентных ставок (керри-трейд) на рынках развивающихся стран приносит доход уже седьмой квартал подряд, что стало самой длинной серией успеха с 2008 года. Согласно индексу Bloomberg, стратегия, предполагающая заимствование в долларах США для инвестиций в высокодоходные валюты, с конца 2024 года принесла около 22% дохода, значительно опередив доходность американских казначейских облигаций. Основу прибыли формирует высокая процентная ставка в странах вроде Турции, однако ключевую роль в последний период сыграло ослабление доллара по отношению ко многим валютам развивающихся рынков. Даже несмотря на падение турецкой лиры, высокая доходность по местным облигациям сохранила прибыльность сделок. Несмотря на испытание в августе из-за интервенций на валютном рынке Японии, рынок быстро адаптировался, переключившись на использование евро и швейцарского франка в качестве финансирующих валют, что позволило продолжить тренд. Главными рисками для стратегии остаются будущие действия ФРС США, которые могут изменить динамику доллара, а также чрезмерная популярность самой сделки, что увеличивает риск резкого разворота. Тем не менее, эксперты, такие как команда PGIM, сохраняют уверенность, выделяя перспективные рынки, включая Турцию, Колумбию, Бразилию и страны Африки.

marsbit1 ч. назад

Получение прибыли в течение 7 кварталов подряд: арбитражные сделки на развивающихся рынках превосходят все

marsbit1 ч. назад

Наставник из Цинхуа и ученик из Уортона раскрыли 40-летнюю нерешённую задачу. Основные математические выкладки написаны GPT. Справились бы и вы.

Новое исследование, проведенное учеными из Университета Цинхуа и Уортонской школы бизнеса, разрешает давний вопрос в теории оптимизации. Они доказали, что классический метод градиентного спуска, использующий только предопределенную последовательность шагов обучения (learning rates), имеет принципиальный предел скорости сходимости. Независимо от того, насколько сложной является эта последовательность, скорость сходимости не может превысить **Ω(T^{-1.9319})**, где T — количество шагов. Это означает, что для достижения оптимальной скорости **O(1/T²)**, полученной методом Нестерова с моментом, необходимо изменить саму структуру алгоритма, а не только подбирать шаги. Ключевым аспектом работы является то, что основное доказательство было сгенерировано и доработано в процессе взаимодействия с языковой моделью GPT-5.6 Sol Pro. Исследователи задавали высокоуровневую стратегию «противостоящего оракула» (resisting oracle), а ИИ выполнил нетривиальную математическую работу по построению доказательства. Затем вся цепочка рассуждений была формально верифицирована с использованием системы автоматического доказательства теорем Lean 4, где код успешно прошел компиляцию без каких-либо пропущенных шагов («zero sorry, zero admit»). Этот результат закрывает 40-летний теоретический пробел, показывая фундаментальное ограничение простейшей формы градиентного спуска. Работа также демонстрирует новый подход к исследованиям, где крупные языковые модели выступают в роли активных помощников в сложных математических доказательствах, проверяемых формальными методами.

marsbit1 ч. назад

Наставник из Цинхуа и ученик из Уортона раскрыли 40-летнюю нерешённую задачу. Основные математические выкладки написаны GPT. Справились бы и вы.

marsbit1 ч. назад

Торговля

Спот
活动图片