Только что, китайский ИИ ворвался в мировую двойку в программировании, впереди остался только Claude

marsbitОпубликовано 2026-05-27Обновлено 2026-05-27

Введение

Сегодня обновление рейтинга Code Arena показало, что китайская модель Qwen3.7-Max от Alibaba набрала 1541 балл и вошла в первую пятерку мировых моделей для программирования, став единственной не-Claude моделью в топ-листе. Она превзошла такие модели, как GPT-5.5 и Gemini 3.5 Flash. В практическом тесте на создание 3D-игры в гонки Qwen3.7-Max продемонстрировала исключительное качество кода и внимание к деталям, выполнив дополнительные требования, такие как создание стартового экрана и добавление звуковых эффектов, с чем другие модели не справились. Это подтвердило её высокие практические способности, помимо результатов в синтетических тестах. Высокая производительность Qwen3.7-Max объясняется её позиционированием как базовой модели (Agent基座模型) для длительного автономного выполнения задач. Внутренние тесты показали, что она способна непрерывно работать до 35 часов, выполняя более 1150 вызовов инструментов без деградации контекста или зацикливания. Два ключевых усовершенствования в обучении способствовали этому прорыву: 1) Расширение окружения (Environment Extension) для развития универсальных стратегий решения задач, и 2) Методология обучения длительному автономному выполнению (Long-range Autonomy), основанная на «динамической накопительной игре на выживание». Появление Qwen3.7-Max в верхней части рейтинга Code Arena, где долгое время доминировали модели Claude, знаменует собой изменение в глобальной конкурентной среде моделей для программирования, представляя Китай как сер...

Именно сегодня вышел свежий рейтинг Code Arena!

Qwen3.7-Max с результатом 1541 балла ворвался в мировой топ-4, обогнав целый ряд ведущих моделей, таких как GPT-5.5, Gemini 3.5 Flash и другие.

Впереди него остались только Claude Opus 4.7 и Opus 4.6.

Другими словами, на мировой арене моделей программирования Alibaba — единственный китайский производитель, пробившийся за этот стол, занимающий второе место после Anthropic.

Qwen3.7-Max врывается в мировой топ-5

Единственная модель не от Claude

На самом деле, ещё до публикации рейтинга Code Arena, Qwen3.7-Max уже завоевала репутацию в среде зарубежных разработчиков.

Atomic Chat провёл жёсткое сравнение, поставив Opus 4.7, GPT-5.5 и Qwen3.7-Max соревноваться друг с другом. Задача — написать самообучающийся ИИ для игры «Тетрис».

В итоге, Qwen3.7-Max не только превзошла Opus 4.7 и GPT-5.5 при стоимости токенов всего в $1.32, но и повысила производительность на 56%.

Другой зарубежный разработчик решил, чтобы Qwen3.7-Max построила 3D-модель вселенной, и результат можно охарактеризовать как потрясающий.

В задаче по генерации «3D пиксельной модели миниатюрной пагоды» скорость и качество вывода Qwen3.7-Max также полностью превзошли конкурентов.

Разработчик Пол Куверт также высоко оценил, что после подключения Qwen3.7-Max к Hermes Agent и OpenCode, она в основном может заменить GPT-5.5 и Opus 4.7.

Программирование — невероятно мощное

Однако высокие бенчмарки — это одно, а реальные испытания — другое.

Мы устроили Qwen3.7-Max жёсткое испытание в виде задачи по созданию «гоночной игры».

Подробный промпт был передан модели, и вскоре Qwen3.7-Max прямо выдала готовый к запуску HTML-файл.

В первой версии была небольшая ошибка: клавиши поворота A/D были перепутаны (влево/вправо).

Но после второго раунда простой корректировки через диалог, полноценная 3D-гоночная игра была запущена.

Честно говоря, в момент открытия мы были немного шокированы.

Четыре машины на трассе одновременно, 3 круга кольцевой гонки, на трассе разбросано более 100 золотых монет, при столкновении с препятствием происходит замедление и потеря контроля.

Панель результатов после гонки включала рейтинг, время, количество монет, самый быстрый круг — ничего не упущено.

Но по-настоящему удивили две детали, которые сделал только Qwen3.7-Max.

Первая — начальный экран. После тестирования четырёх моделей, только он создал полноценный начальный экран для игры, и нажатие «Start» запускало гонку. Остальные три сразу начинали гонку, без даже заглавного экрана.

Вторая — звуковые эффекты. В конце промпта было дополнительное требование добавить звук рева двигателя и звук сбора монет. Из четырёх моделей только Qwen3.7-Max реализовал этот бонус, добавив и звук двигателя, и звон монет.

Давайте посмотрим на результаты других участников.

Графика Gemini 3.5 Flash заметно беднее, не хватает того ощущения объёма.

С расположением элементов UI тоже проблемы: информация на приборной панели разбросана по четырём углам экрана, визуальный фокус рассеян.

В то время как Qwen3.7-Max разместил ключевые показатели в центре экрана, что более естественно для взгляда игрока.

Результат Claude Opus 4.6... сложно описать словами.

Не только монет на трассе было катастрофически мало, но и 3 машины с ИИ двигались почти синхронно, без какой-либо случайности, как будто скопированные.

Наконец, GPT-5.5.

Видно, что качество графики действительно лучше, чем у первых двух, и управление более плавное.

Но непонятно почему, монеты были сделаны в виде жёлтых «пончиков»...

Форма — мелочь. Ключевое в том, что Gemini, Claude и ChatGPT потребовалось несколько раундов исправления багов, чтобы запустить все функции.

Только Qwen3.7-Max в первом раунде сгенерировал в основном играбельную версию.

Результаты тестов близки, практические испытания подтверждают, а цена составляет лишь доли от конкурентов. Остальное — за разработчиками и их выбором.

«Базовая» модель эпохи Agent

То, как Qwen3.7-Max смог продемонстрировать такой уровень на самой конкурентной арене программирования, скрыто в его продуктовом позиционировании.

Несколько дней назад, когда Alibaba представляла Qwen3.7-Max, ей был присвоен очень специфический ярлык: Базовая модель для Agent.

Она создана как модель, предназначенная для длительного автономного выполнения задач.

Данные внутреннего тестирования показывают, что в одной автономной задаче по программированию Qwen3.7-Max непрерывно работала 35 часов, выполнив 1158 вызовов инструментов.

В итоге сгенерированный код по сравнению с эталонной реализацией Triton достиг ошеломляющего 10-кратного среднего геометрического ускорения.

Ещё более впечатляет её способность вести «затяжные бои» —

Даже после 30 часов рассуждений модель сохраняла остроту и продолжала находить новые возможности для оптимизации.

Полностью без деградации контекста, без дрейфа инструкций, без бесконечных циклов!

Нужно признать, что сложность не в самих 1000 вызовах инструментов. С распространением протокола MCP, 1000 вызовов — не редкость.

Сложность в 35 часах последовательных рассуждений.

Большинство моделей «ломаются» при выполнении длительных задач: либо контекст накапливается и путается, цели, поставленные вначале, к концу полностью забываются; либо они входят в бесконечный цикл, повторяя одну и ту же неудачную стратегию.

Qwen3.7-Max смогла реализовать принцип «постоянно делать правильные вещи».

Раскрытие ключевых технологий

Мы полагаем, что этот скачок Qwen3.7-Max в программировании может быть связан с улучшением двух методов обучения.

Во-первых, расширение среды (Environment Expansion).

При обучении программированию каждая задача для Qwen3.7-Max разделяется на три независимых измерения: сама задача, среда выполнения и способ проверки. Эти три компонента комбинируются произвольно.

Одна и та же задача иногда выполняется в среде Claude Code, иногда в OpenClaw, иногда с другим способом проверки.

Эффект похож на то, как стажёра ротируют по всем проектным группам. Он вынужден учиться универсальным стратегиям решения проблем, а не «как схитрить в конкретной среде».

Это объясняет неинтуитивное явление: Qwen3.7-Max стабильно показывает себя в средах Claude Code, OpenClaw, Qwen Code, без ситуации «отлично в своей среде, но провал в другой».

Второе улучшение — длительное автономное выполнение (Long-Range Autonomous Execution).

В обучение команда внедрила фреймворк «динамической накопительной игры на выживание».

То есть, модель принимает последовательные решения на протяжении более тысячи шагов в постоянно меняющейся симулированной среде, самостоятельно строит гипотезы, корректирует стратегию на основе обратной связи, и при этом не должна страдать от «коррупции контекста» из-за долгой работы.

Есть наглядные данные: в симуляции управления стартапом в течение целого года по бенчмарку YC-Bench, Qwen3.7-Max достигла выручки в 2.08 миллиона долларов, что в два раза больше, чем у предыдущего поколения (1.05 млн).

Что ещё важнее, она продемонстрировала эволюцию стратегии: в середине, столкнувшись с кризисом, смогла самостоятельно изменить направление, выявить и заблокировать злонамеренных клиентов, в конечном итоге сойдясь к стабильному циклу выполнения.

Это основа для случая с 35-часовой оптимизацией ядра, и именно поэтому в Kernel Bench L3, Qwen3.7-Max смогла обеспечить ускорение в 96% сценариев.

А программирование — лишь первое поле битвы. Эта основа долгосрочных рассуждений и вызова инструментов указывает на более масштабные амбиции — универсальную базовую модель для Agent.

В финал программирования добавился новый «нарушитель спокойствия»

С момента своего запуска, Code Arena всегда тестировал суровые навыки: многошаговые рассуждения, оркестрация инструментов, доставка целых проектов — всё это настоящие испытания уровня Agent.

Сегодня Qwen3.7-Max с результатом 1541 балла вклинилась на четвёртое место, между Opus 4.6 Thinking и Opus 4.6.

На этой трассе, где Claude доминировал большую часть года, она дала свой ответ: китайские модели — не просто догоняющие, они тоже могут быть определяющими игроками.

Мировая гонка моделей программирования больше не является монополией Кремниевой долины.

Источники:

https://arena.ai/leaderboard/code/webdev

Статья взята с официального аккаунта WeChat «Новая Эпоха Искусственного Интеллекта», автор: ASI Апокалипсис

Связанные с этим вопросы

QКакой китайский ИИ-модель вошла в первую пятёрку глобального рейтинга Code Arena и какое место она заняла?

AМодель Qwen3.7-Max от компании Alibaba заняла четвёртое место в глобальном рейтинге Code Arena.

QКакие модели в рейтинге Code Arena опережают китайскую Qwen3.7-Max?

AВпереди Qwen3.7-Max находятся модели Claude Opus 4.7 и Claude Opus 4.6 от компании Anthropic.

QПочему Qwen3.7-Max описывается как "базовая модель для агентов" (Agent Base Model)?

AQwen3.7-Max разрабатывалась как базовая модель для агентов, предназначенная для длительного автономного выполнения задач. Она способна вести непрерывное рассуждение до 35 часов, совершать множество вызовов инструментов без деградации контекста или потери цели.

QКакие два метода обучения, согласно статье, способствовали успеху Qwen3.7-Max в программировании?

AПервым методом является "расширение среды" (environment expansion), где задачи разбиваются на независимые измерения (сама задача, фреймворк исполнения, способ валидации) и свободно комбинируются. Второй — "долгосрочное автономное исполнение" (long-range autonomous execution), при котором модель обучается в динамической среде на последовательности из более чем тысячи шагов.

QКак Qwen3.7-Max проявила себя в практическом тесте по созданию игры-гонки по сравнению с другими моделями?

AВ тесте на создание 3D-игры гонок Qwen3.7-Max с первой попытки сгенерировала играбельный HTML-файл с минимальными багами. Она единственная добавила стартовый экран и звуковые эффекты, как требовалось в задании, в то время как другие модели (Gemini, Claude, ChatGPT) нуждались в нескольких итерациях исправления ошибок.

Похожее

После трёх кварталов падения: получится ли у крипторынка стабилизироваться в третьем квартале?

Криптовалютный рынок пережил худший квартал с 2022 года, общая капитализация упала на 12,6% до $2,1 трлн, а дневные объемы торгов снизились на 20,9%. Впервые за три года сократилась и капитализация стейблкоинов. Основные факторы спада — отток средств из биткоин-ETF, распродажа биткоинов корпоративным казначейством Strategy и ужесточение монетарной политики ФРС. Второй квартал завершился чистым оттоком $46,7 млрд из ETF, при этом в июне отток достиг рекордных $45 млрд. Ключевым событием третьего квартала станет заседание ФРС 28–29 июля. Мягкий сигнал может поддержать биткоин в диапазоне $68 000–84 000 и вернуть приток в ETF, тогда как жесткая риторика способна сместить торговый диапазон к $50 000–56 000. Законодательная неопределенность также давит на рынок: прогресс по закону CLARITY Act, определяющему регуляторные границы, замедлился, и вероятность его принятия в 2026 году упала до 40–45%. Несмотря на общий спад, два сегмента показали рост: объемы на рынках предсказаний выросли на 48,7%, а торговля токенизированными коллекционными предметами увеличилась на 143%. Сектор RWA продолжает стабильно развиваться, достигнув $28,1 млрд. Рынок, вероятно, миновал фазу острой распродажи, но для устойчивого восстановления необходимы ясность от ФРС и регуляторный прогресс.

marsbit4 ч. назад

После трёх кварталов падения: получится ли у крипторынка стабилизироваться в третьем квартале?

marsbit4 ч. назад

BIT Торговые часы: BTC по-прежнему под давлением 200 EMA на недельном графике, после отскока возможен перезапуск нисходящего движения; секторы хранения данных и полупроводников, выросшие ночью, начали падение в вечерней сессии

**Краткий обзор рынка: BTC под давлением, коррекция на рынке акций, внимание к данным и событиям** Рынок криптовалют демонстрирует осторожное восстановление. Bitcoin торгуется около $66 000, сталкиваясь со значительным сопротивлением в районе $68 000, где сосредоточены объемные "застрявшие" позиции. Ключевые технические уровни — 200-недельная скользящая средняя (~$63 333) и 200-недельная EMA (~$68 328). Аналитики отмечают низкую ликвидность, характерную для летнего периода. На фондовом рынке после сильного роста во вторник наблюдается коррекция. Фьючерсы на основные индексы США снижаются. Акции полупроводниковой и памяти, которые резко выросли накануне, падают в ночных торгах. Исключением стал SMCI, который вырос более чем на 15% после оптимистичного прогноза. На общий настрой негативно влияют рост цен на нефть (более $91 за баррель Brent) и доходности государственных облигаций США (10-летние — около 4,64%), что возрождает инфляционные опасения. Азиатские рынки показали нестабильную динамику. Индекс KOSPI в Корее вырос на 0,74%, а японский Nikkei 225 снизился на 0,18%. Основной риск для региона — ослабление японской иены до минимумов с 1986 года, что повышает вероятность вмешательства властей. **Ключевые события для наблюдения:** * **24 июля:** Финансовые отчеты Alphabet (Google), Tesla, IBM. Событие AMD, посвященное ИИ. * **25 июля:** Решение по процентной ставке ЕЦБ и пресс-конференция Кристин Лагард. Финансовые отчеты Intel, American Airlines, Honeywell и других. Данные по числу первичных заявок на пособие по безработице в США.

marsbit4 ч. назад

BIT Торговые часы: BTC по-прежнему под давлением 200 EMA на недельном графике, после отскока возможен перезапуск нисходящего движения; секторы хранения данных и полупроводников, выросшие ночью, начали падение в вечерней сессии

marsbit4 ч. назад

Бывший глава CFTC и президент Circle Тарберт: призывает к долгосрочной стратегии, но сам выводит $30 млн

Бывший председатель CFTC и президент Circle Хит Тарберт, публично пропагандируя долгосрочное видение компании для инвесторов на фоне падения акций на 70% с пиковых значений, сам активно распродавал свои акции CRCL. С момента IPO Circle он по плану 10b5-1 продал более 360 тысяч акций, выручив около 30 миллионов долларов, и при этом ни разу не докупал акции на открытом рынке. Эта разница между его публичными заявлениями и личными действиями вызвала критику. Карьера Тарберта демонстрирует классическое использование «вращающейся двери» между регулирующими органами и частным сектором. Уйдя с поста председателя CFTC в 2021 году, через 27 дней он занял должность главного юрисконсульта в маркет-мейкере Citadel Securities, который в тот момент находился под пристальным вниманием из-за скандала с акциями GameStop. Позже, уже работая в Citadel, Тарберт выступал за расширение полномочий CFTC на крипторынок, в то время как его работодатель планировал выход на этот рынок. В 2023 году Тарберт присоединился к Circle, где его опыт и связи сыграли ключевую роль в успешном проведении IPO компании в 2025 году. Однако его последующие массовые продажи акций, совпавшие с падением котировок и его же призывами к долгосрочным инвестициям, ставят под сомнение искренность его уверенности в будущем компании. Критики видят в его карьере образец превращения регуляторного опыта и политических связей в личную выгоду, в то время как риски несут обычные инвесторы, верящие его нарративам.

marsbit4 ч. назад

Бывший глава CFTC и президент Circle Тарберт: призывает к долгосрочной стратегии, но сам выводит $30 млн

marsbit4 ч. назад

Gate Research: Взлет «уолл-стритизации» криптофинансовых продуктов — это конкуренция или интеграция?

**Аналитический обзор Gate Research Institute: Волна "уолл-стритизации" криптофинансовых продуктов — конкуренция или интеграция?** Создание биткоина в 2009 году было ответом на финансовый кризис и стремлением построить децентрализованную систему без доверенных посредников. Однако к 2026 году значительная часть биткоинов (около 7,14%) хранится через ETF таких гигантов, как BlackRock. Это символизирует глубокую интеграцию традиционных финансов (TradFi) и крипторынка. С появлением биткоин-ETF, фьючерсов, RWA (токенизированных реальных активов) и государственных облигаций на блокчейне, традиционные институты получают всё больше влияния на выпуск, ценообразование, кастодию и дистрибуцию криптоактивов. Однако это не одностороннее поглощение, а взаимодополняющая конвергенция. Криптосфера приносит TradFi глобальную 24/7 ликвидность и программируемость, а TradFi предоставляет криптосфере регулируемые каналы, институциональное доверие и массовый доступ. Яркий пример — две противоположные, но ведущие к одной цели траектории: * **Путь А:** Криптобиржи, такие как Gate, начинают с токенизированных акций и CFD, а затем напрямую подключаются к инфраструктуре традиционных брокеров, предлагая реальную торговлю акциями США, Гонконга и Кореи за стейблкоины. * **Путь Б:** Традиционные брокеры, такие как Robinhood, интегрируют криптоактивы, а затем создают собственные Layer 2 для токенизации своих акций, стремясь к круглосуточной торговле. Обе стратегии нацелены на создание **универсального финансового аккаунта будущего** — единой точки доступа к акциям, криптовалютам, ETF, токенизированным облигациям и другим активам. Ключевой конкурентной борьбой становится не между CEX и брокерами, а между этими "супераккаунтами". Параллельно, слой RWA и токенизированных гособлигаций растёт даже на медвежьем рынке, становясь "прослойкой" для объединения капиталов. Хотя этот рынок (около $150 млрд токенизированных казначейских облигаций) ещё мал по сравнению с традиционным ($30 трлн), он демонстрирует устойчивый структурный тренд, привлекающий крупнейшие финансовые институты (JPMorgan, DTCC и др.). **Вывод:** "Уолл-стритизация" — это не поражение идеалов децентрализации, а формирование новой гибридной модели. Децентрализованные протоколы продолжают работать на базовом уровне, в то время как на уровне приложений и пользовательского опыта формируется более эффективный, глобальный и свободный объединённый рынок капитала, где активы TradFi и DeFi торгуются бок о бок в одном интерфейсе. Уолл-стрит не завоевала криптосферу, а криптосфера не обошла Уолл-стрит — они совместно строят новые финансовые рельсы.

marsbit4 ч. назад

Gate Research: Взлет «уолл-стритизации» криптофинансовых продуктов — это конкуренция или интеграция?

marsbit4 ч. назад

S&P Dow Jones и Pantera выпускают криптоиндекс, биткоин оставлен за бортом из-за «отсутствия прибыли»

Стандард энд Пурс (S&P Dow Jones Indices) совместно с Pantera Capital запускает индекс S&P Pantera Digital Asset Index. Новый индекс включает 18 токенов, но исключает биткоин, XRP и мем-токены. Критерием отбора послужила «финансовая жизнеспособность», по аналогии с S&P 500: протокол должен демонстрировать положительный доход в течение нескольких кварталов и распределять стоимость среди держателей токенов. Это первое применение фундаментального подхода к оценке криптоактивов со стороны крупнейшего в мире провайдера индексов. В первую пятерку активов вошли Ethereum (ETH), BNB, Solana (SOL), TRON (TRX) и Hyperliquid (HYPE). Pantera отмечает, что совокупный годовой доход всех протоколов индекса превышает $30 млрд. Биткоин был исключен по трем причинам: он рассматривается как монетарный актив, доступный через отдельные ETF; он не генерирует доход протокола; а смешивание его в индексе с доходными активами затрудняет фундаментальный анализ для институциональных инвесторов. Пока индекс является эталонным, но Pantera ведет переговоры о создании на его основе ETF и других инвестиционных продуктов. Компания также отмечает значительный разрыв на рынке: многие институциональные инвесторы готовы к аллокации в криптоактивы, но им не хватает структурированных продуктов, фокусирующихся на активах с реальной экономической деятельностью.

marsbit4 ч. назад

S&P Dow Jones и Pantera выпускают криптоиндекс, биткоин оставлен за бортом из-за «отсутствия прибыли»

marsbit4 ч. назад

Торговля

Спот
活动图片