Только что, китайский ИИ ворвался в мировую двойку в программировании, впереди остался только Claude

marsbitОпубликовано 2026-05-27Обновлено 2026-05-27

Введение

Сегодня обновление рейтинга Code Arena показало, что китайская модель Qwen3.7-Max от Alibaba набрала 1541 балл и вошла в первую пятерку мировых моделей для программирования, став единственной не-Claude моделью в топ-листе. Она превзошла такие модели, как GPT-5.5 и Gemini 3.5 Flash. В практическом тесте на создание 3D-игры в гонки Qwen3.7-Max продемонстрировала исключительное качество кода и внимание к деталям, выполнив дополнительные требования, такие как создание стартового экрана и добавление звуковых эффектов, с чем другие модели не справились. Это подтвердило её высокие практические способности, помимо результатов в синтетических тестах. Высокая производительность Qwen3.7-Max объясняется её позиционированием как базовой модели (Agent基座模型) для длительного автономного выполнения задач. Внутренние тесты показали, что она способна непрерывно работать до 35 часов, выполняя более 1150 вызовов инструментов без деградации контекста или зацикливания. Два ключевых усовершенствования в обучении способствовали этому прорыву: 1) Расширение окружения (Environment Extension) для развития универсальных стратегий решения задач, и 2) Методология обучения длительному автономному выполнению (Long-range Autonomy), основанная на «динамической накопительной игре на выживание». Появление Qwen3.7-Max в верхней части рейтинга Code Arena, где долгое время доминировали модели Claude, знаменует собой изменение в глобальной конкурентной среде моделей для программирования, представляя Китай как сер...

Именно сегодня вышел свежий рейтинг Code Arena!

Qwen3.7-Max с результатом 1541 балла ворвался в мировой топ-4, обогнав целый ряд ведущих моделей, таких как GPT-5.5, Gemini 3.5 Flash и другие.

Впереди него остались только Claude Opus 4.7 и Opus 4.6.

Другими словами, на мировой арене моделей программирования Alibaba — единственный китайский производитель, пробившийся за этот стол, занимающий второе место после Anthropic.

Qwen3.7-Max врывается в мировой топ-5

Единственная модель не от Claude

На самом деле, ещё до публикации рейтинга Code Arena, Qwen3.7-Max уже завоевала репутацию в среде зарубежных разработчиков.

Atomic Chat провёл жёсткое сравнение, поставив Opus 4.7, GPT-5.5 и Qwen3.7-Max соревноваться друг с другом. Задача — написать самообучающийся ИИ для игры «Тетрис».

В итоге, Qwen3.7-Max не только превзошла Opus 4.7 и GPT-5.5 при стоимости токенов всего в $1.32, но и повысила производительность на 56%.

Другой зарубежный разработчик решил, чтобы Qwen3.7-Max построила 3D-модель вселенной, и результат можно охарактеризовать как потрясающий.

В задаче по генерации «3D пиксельной модели миниатюрной пагоды» скорость и качество вывода Qwen3.7-Max также полностью превзошли конкурентов.

Разработчик Пол Куверт также высоко оценил, что после подключения Qwen3.7-Max к Hermes Agent и OpenCode, она в основном может заменить GPT-5.5 и Opus 4.7.

Программирование — невероятно мощное

Однако высокие бенчмарки — это одно, а реальные испытания — другое.

Мы устроили Qwen3.7-Max жёсткое испытание в виде задачи по созданию «гоночной игры».

Подробный промпт был передан модели, и вскоре Qwen3.7-Max прямо выдала готовый к запуску HTML-файл.

В первой версии была небольшая ошибка: клавиши поворота A/D были перепутаны (влево/вправо).

Но после второго раунда простой корректировки через диалог, полноценная 3D-гоночная игра была запущена.

Честно говоря, в момент открытия мы были немного шокированы.

Четыре машины на трассе одновременно, 3 круга кольцевой гонки, на трассе разбросано более 100 золотых монет, при столкновении с препятствием происходит замедление и потеря контроля.

Панель результатов после гонки включала рейтинг, время, количество монет, самый быстрый круг — ничего не упущено.

Но по-настоящему удивили две детали, которые сделал только Qwen3.7-Max.

Первая — начальный экран. После тестирования четырёх моделей, только он создал полноценный начальный экран для игры, и нажатие «Start» запускало гонку. Остальные три сразу начинали гонку, без даже заглавного экрана.

Вторая — звуковые эффекты. В конце промпта было дополнительное требование добавить звук рева двигателя и звук сбора монет. Из четырёх моделей только Qwen3.7-Max реализовал этот бонус, добавив и звук двигателя, и звон монет.

Давайте посмотрим на результаты других участников.

Графика Gemini 3.5 Flash заметно беднее, не хватает того ощущения объёма.

С расположением элементов UI тоже проблемы: информация на приборной панели разбросана по четырём углам экрана, визуальный фокус рассеян.

В то время как Qwen3.7-Max разместил ключевые показатели в центре экрана, что более естественно для взгляда игрока.

Результат Claude Opus 4.6... сложно описать словами.

Не только монет на трассе было катастрофически мало, но и 3 машины с ИИ двигались почти синхронно, без какой-либо случайности, как будто скопированные.

Наконец, GPT-5.5.

Видно, что качество графики действительно лучше, чем у первых двух, и управление более плавное.

Но непонятно почему, монеты были сделаны в виде жёлтых «пончиков»...

Форма — мелочь. Ключевое в том, что Gemini, Claude и ChatGPT потребовалось несколько раундов исправления багов, чтобы запустить все функции.

Только Qwen3.7-Max в первом раунде сгенерировал в основном играбельную версию.

Результаты тестов близки, практические испытания подтверждают, а цена составляет лишь доли от конкурентов. Остальное — за разработчиками и их выбором.

«Базовая» модель эпохи Agent

То, как Qwen3.7-Max смог продемонстрировать такой уровень на самой конкурентной арене программирования, скрыто в его продуктовом позиционировании.

Несколько дней назад, когда Alibaba представляла Qwen3.7-Max, ей был присвоен очень специфический ярлык: Базовая модель для Agent.

Она создана как модель, предназначенная для длительного автономного выполнения задач.

Данные внутреннего тестирования показывают, что в одной автономной задаче по программированию Qwen3.7-Max непрерывно работала 35 часов, выполнив 1158 вызовов инструментов.

В итоге сгенерированный код по сравнению с эталонной реализацией Triton достиг ошеломляющего 10-кратного среднего геометрического ускорения.

Ещё более впечатляет её способность вести «затяжные бои» —

Даже после 30 часов рассуждений модель сохраняла остроту и продолжала находить новые возможности для оптимизации.

Полностью без деградации контекста, без дрейфа инструкций, без бесконечных циклов!

Нужно признать, что сложность не в самих 1000 вызовах инструментов. С распространением протокола MCP, 1000 вызовов — не редкость.

Сложность в 35 часах последовательных рассуждений.

Большинство моделей «ломаются» при выполнении длительных задач: либо контекст накапливается и путается, цели, поставленные вначале, к концу полностью забываются; либо они входят в бесконечный цикл, повторяя одну и ту же неудачную стратегию.

Qwen3.7-Max смогла реализовать принцип «постоянно делать правильные вещи».

Раскрытие ключевых технологий

Мы полагаем, что этот скачок Qwen3.7-Max в программировании может быть связан с улучшением двух методов обучения.

Во-первых, расширение среды (Environment Expansion).

При обучении программированию каждая задача для Qwen3.7-Max разделяется на три независимых измерения: сама задача, среда выполнения и способ проверки. Эти три компонента комбинируются произвольно.

Одна и та же задача иногда выполняется в среде Claude Code, иногда в OpenClaw, иногда с другим способом проверки.

Эффект похож на то, как стажёра ротируют по всем проектным группам. Он вынужден учиться универсальным стратегиям решения проблем, а не «как схитрить в конкретной среде».

Это объясняет неинтуитивное явление: Qwen3.7-Max стабильно показывает себя в средах Claude Code, OpenClaw, Qwen Code, без ситуации «отлично в своей среде, но провал в другой».

Второе улучшение — длительное автономное выполнение (Long-Range Autonomous Execution).

В обучение команда внедрила фреймворк «динамической накопительной игры на выживание».

То есть, модель принимает последовательные решения на протяжении более тысячи шагов в постоянно меняющейся симулированной среде, самостоятельно строит гипотезы, корректирует стратегию на основе обратной связи, и при этом не должна страдать от «коррупции контекста» из-за долгой работы.

Есть наглядные данные: в симуляции управления стартапом в течение целого года по бенчмарку YC-Bench, Qwen3.7-Max достигла выручки в 2.08 миллиона долларов, что в два раза больше, чем у предыдущего поколения (1.05 млн).

Что ещё важнее, она продемонстрировала эволюцию стратегии: в середине, столкнувшись с кризисом, смогла самостоятельно изменить направление, выявить и заблокировать злонамеренных клиентов, в конечном итоге сойдясь к стабильному циклу выполнения.

Это основа для случая с 35-часовой оптимизацией ядра, и именно поэтому в Kernel Bench L3, Qwen3.7-Max смогла обеспечить ускорение в 96% сценариев.

А программирование — лишь первое поле битвы. Эта основа долгосрочных рассуждений и вызова инструментов указывает на более масштабные амбиции — универсальную базовую модель для Agent.

В финал программирования добавился новый «нарушитель спокойствия»

С момента своего запуска, Code Arena всегда тестировал суровые навыки: многошаговые рассуждения, оркестрация инструментов, доставка целых проектов — всё это настоящие испытания уровня Agent.

Сегодня Qwen3.7-Max с результатом 1541 балла вклинилась на четвёртое место, между Opus 4.6 Thinking и Opus 4.6.

На этой трассе, где Claude доминировал большую часть года, она дала свой ответ: китайские модели — не просто догоняющие, они тоже могут быть определяющими игроками.

Мировая гонка моделей программирования больше не является монополией Кремниевой долины.

Источники:

https://arena.ai/leaderboard/code/webdev

Статья взята с официального аккаунта WeChat «Новая Эпоха Искусственного Интеллекта», автор: ASI Апокалипсис

Связанные с этим вопросы

QКакой китайский ИИ-модель вошла в первую пятёрку глобального рейтинга Code Arena и какое место она заняла?

AМодель Qwen3.7-Max от компании Alibaba заняла четвёртое место в глобальном рейтинге Code Arena.

QКакие модели в рейтинге Code Arena опережают китайскую Qwen3.7-Max?

AВпереди Qwen3.7-Max находятся модели Claude Opus 4.7 и Claude Opus 4.6 от компании Anthropic.

QПочему Qwen3.7-Max описывается как "базовая модель для агентов" (Agent Base Model)?

AQwen3.7-Max разрабатывалась как базовая модель для агентов, предназначенная для длительного автономного выполнения задач. Она способна вести непрерывное рассуждение до 35 часов, совершать множество вызовов инструментов без деградации контекста или потери цели.

QКакие два метода обучения, согласно статье, способствовали успеху Qwen3.7-Max в программировании?

AПервым методом является "расширение среды" (environment expansion), где задачи разбиваются на независимые измерения (сама задача, фреймворк исполнения, способ валидации) и свободно комбинируются. Второй — "долгосрочное автономное исполнение" (long-range autonomous execution), при котором модель обучается в динамической среде на последовательности из более чем тысячи шагов.

QКак Qwen3.7-Max проявила себя в практическом тесте по созданию игры-гонки по сравнению с другими моделями?

AВ тесте на создание 3D-игры гонок Qwen3.7-Max с первой попытки сгенерировала играбельный HTML-файл с минимальными багами. Она единственная добавила стартовый экран и звуковые эффекты, как требовалось в задании, в то время как другие модели (Gemini, Claude, ChatGPT) нуждались в нескольких итерациях исправления ошибок.

Похожее

Заработок в миллион на электриках: Meta спешно открывает собственное ПТУ

Новый этап конкуренции в сфере искусственного интеллекта столкнулся с неожиданным препятствием — острой нехваткой квалифицированных технических специалистов, особенно электриков и строителей, для возведения сверхмощных центров обработки данных. В США, согласно прогнозам, к 2030 году для инфраструктуры ИИ потребуется дополнительно 130 000 электриков и 240 000 строителей, однако ежегодно остается незаполненными около 80 000 вакансий электриков. Компании, такие как OpenAI (проект "Stargate" стоимостью $160 млрд), Meta и Microsoft, сталкиваются с огромными убытками из-за задержек строительства. Например, задержка ввода центра мощностью 60 МВт может обернуться потерей $14,2 млн в месяц. Причина спроса — беспрецедентная сложность строительства ИИ-центров. Они потребляют колоссальную энергию (сотни мегаватт), требуют уникальных систем электроснабжения и охлаждения (жидкостное или иммерсионное), что делает работу высококвалифицированных монтажников, сантехников и инженеров незаменимой. Для решения проблемы кадрового голода ИИ-гиганты начали масштабные программы обучения. Meta инвестировала $115 млн в создание собственной школы строителей с бесплатным обучением и стипендией, а OpenAI сотрудничает с профсоюзами. Активная вербовка ведется даже среди старшеклассников. Потребление энергии ИИ-центрами растет экспоненциально, опережая общий рост энергопотребления в 16 раз и увеличивая счета за электричество для потребителей. Однако строительство таких объектов носит проектный характер: для возведения центра "Stargate" требуется 6400 рабочих, а для его обслуживания — всего 100-1000. Это создает риск перенасыщения рынка труда после завершения строительного бума, что может привести к падению зарплат в отрасли.

marsbit54 мин. назад

Заработок в миллион на электриках: Meta спешно открывает собственное ПТУ

marsbit54 мин. назад

OpenAI больше не зарабатывает на самых дорогих моделях

В статье говорится о том, что OpenAI скорректировала цены на свои модели ИИ. Флагманская модель GPT-5.6Luna подешевела на 80%, а Terra — на 20%. Но главное не в этом, а в смене стратегии. OpenAI впервые рекомендует клиентам использовать не самую мощную и дорогую модель для всех задач, а подбирать модель под конкретную задачу. Например, для сложного планирования можно использовать Sol, а для рутинного выполнения — более дешевую Luna. Аналогичные шаги предприняла и Anthropic, выпустив более доступную модель Claude Opus 5. Это говорит о том, что индустрия переходит от гонки за "самым умным" ИИ к созданию "массовых" решений. Флагманские модели остаются для демонстрации технологического лидерства, а основную прибыль приносят более дешевые и эффективные модели для повседневного использования. OpenAI также отмечает, что снижение цен стало возможным благодаря тому, что сами модели ИИ теперь участвуют в оптимизации своего собственного кода и процессов, создавая цикл ускоренного снижения затрат. Ключевая мысль: бизнес-модель смещается от продажи "интеллекта" к продаже "потребления" (API-вызовов). Цель — стать неотъемлемой частью бизнес-процессов, как электричество, делая миграцию на другую платформу слишком дорогой. Будущее ИИ — не в громких флагманских релизах, а в повсеместной и невидимой интеграции.

marsbit54 мин. назад

OpenAI больше не зарабатывает на самых дорогих моделях

marsbit54 мин. назад

Предполагаемая 4-я волна атак на Coldcard уносит 389 биткоинов: Галактики Торн

Пользователям аппаратных кошельков Coldcard угрожает новая волна скоординированных краж биткойнов, произошедшая всего через несколько дней после первой атаки в четверг. Алекс Торн, глава исследований Galaxy, сообщил в понедельник о 218 транзакциях, затронувших 462 потенциальных адреса жертв, в результате чего было перемещено около 388,9 BTC. Торн отметил, что активность составляла в среднем 13,8 переводов на блок, что примерно в 45 раз выше обычного уровня. Большинство средств переводились на новые уникальные адреса, а не в один центральный кошелек. Часть средств уже была перемещена на адреса второго уровня. Исследователь заявил, что эти транзакции, вероятно, направлены против пользователей Coldcard, так как соответствуют характеру уязвимых неделимых выходов транзакций (UTXO) кошелька. В мемпуле также находятся ожидающие подтверждения похожие транзакции. Пострадавшие пользователи, контролирующие ключи, могут попытаться опередить злоумышленников, отправив конфликтующую транзакцию с более высокой комиссией для перевода средств на безопасный кошелек. Данные инциденты связаны с ранее необнаруженным недостатком в прошивке Coldcard, из-за которого некоторые устройства генерировали сиды кошельков с меньшей энтропией. По последним оценкам, затронуто более 1100 кошельков, а сумма украденных средств достигла 90 миллионов долларов.

cointelegraph1 ч. назад

Предполагаемая 4-я волна атак на Coldcard уносит 389 биткоинов: Галактики Торн

cointelegraph1 ч. назад

Обязательно ли ФРС повысит ставки в сентябре? Как это повлияет на криптовалюты и фондовый рынок?

За последнюю неделю рыночные ожидания повышения ставки ФРС в сентябре резко выросли с менее чем 50% до более чем 80%, что оказало давление на криптовалюты и связанные с ними акции. Ключевой причиной стал рост цен на нефть из-за эскалации геополитической напряженности вокруг Ормузского пролива, что усилило опасения по поводу инфляции. На июльском заседании ФРС сохранила ставку, но расклад голосов 9-3 в пользу сохранения показал усиление позиций сторонников ужесточения политики. Следующим важным ориентиром станут данные по инфляции (CPI) за июль, публикация которых 12 августа может существенно скорректировать ожидания. Для крипторынка, в частности для Bitcoin, усиление ожиданий повышения ставок создает краткосрочное давление, поскольку активы, не приносящие доход, становятся менее привлекательными. Однако исторически Bitcoin демонстрировал устойчивость, когда траектория повышения ставок уже была учтена рынком. Решающим фактором часто является не сам факт повышения, а изменение ожиданий относительно будущего цикла монетарной политики. Акции компаний, связанных с криптоиндустрией, такие как Coinbase и MicroStrategy, обычно демонстрируют более высокую волатильность в ответ на изменение ожиданий по ставкам. Для рынка акций в целом, особенно для технологического сектора с высокими оценками, рост стоимости заимствований может увеличить давление на мультипликаторы. Это совпадает с сезоном отчетности, когда инвесторы начали более пристально оценивать, приводят ли высокие капитальные затраты компаний на ИИ к реальному росту выручки и денежных потоков. Если ФРС повысит ставки в сентябре, толерантность рынка к "историям роста" за счет "сжигания денег" может снизиться, что усилит волатильность.

marsbit1 ч. назад

Обязательно ли ФРС повысит ставки в сентябре? Как это повлияет на криптовалюты и фондовый рынок?

marsbit1 ч. назад

Биткоин-майнеры массово сдаются, но их акции растут

Автор: Matt Crosby Хэшрейт сети Биткоин продолжает снижаться несколько месяцев подряд, а сложность майнинга зафиксировала одно из самых резких падений в истории. Обычно это означает, что майнеры отключают оборудование из-за нерентабельности. Однако в этот раз акции публичных майнинговых компаний демонстрируют один из лучших результатов за последние годы, в то время как цена BTC значительно снизилась. Исторически давление на майнеров и падение цены происходили синхронно, но сейчас наблюдается их расхождение, и рынок, возможно, ещё не полностью оценил долгосрочные последствия этого для хэшрейта. **Ключевые моменты:** * Хэшрейт сигнализирует об одной из самых продолжительных фаз капитуляции майнеров. * Сложность майнинга упала на 19,9% от пика, что является третьим самым глубоким снижением с эпохи ASIC-майнеров. * Акции майнинговых компаний значительно опередили BTC по доходности за год, несмотря на продажу тысяч биткоинов. * Доход от вознаграждения за блок в пересчёте на BTC достиг рекордно низкого суточного уровня. * Средний доход от комиссий за последние 28 дней даже не покрывает субсидию за один блок. Майнеры действительно капитулируют. Снижение сложности на 19,9% — это механизм протокола, работающий как задумано. Лишь два аналогичных периода были глубже, один из которых последовал за запретом майнинга в Китае. При этом акции крупнейших публичных майнеров выросли на 430% за год, тогда как BTC упал примерно на 46%. Это резкий отход от их традиционной роли "BTC с левериджем". Основной драйвер роста — нарратив об искусственном интеллекте (ИИ), который изменил корреляцию между этими активами. Доход майнеров от вознаграждения за блок (субсидии) в биткоинах достиг исторического минимума. Это следствие предсказуемого механизма халвинга, сокращающего эмиссию каждые четыре года. Хотя пока рост цены BTC компенсировал это снижение в долларовом выражении, показатель Puell Multiple (около 0,75) указывает, что текущий ежедневный доход (~$30 млн) ниже годового среднего (~$40 млн). В долгосрочной перспективе субсидию должны заменить комиссии. Однако сейчас они составляют лишь около $200 тыс. в день против $30 млн от субсидий. Среднесуточных комиссий за месяц не хватает даже на покрытие одного блока, в то время как сеть создаёт около 144 блоков в день. Эта фаза капитуляции отличается от предыдущих. Майнеры нашли более прибыльное применение своему оборудованию (ИИ) на фоне падения цены BTC, сокращения субсидий и стагнации комиссий. Хотя непосредственных рисков для безопасности сети нет, текущая ситуация highlights структурные вопросы激励机制 майнеров, которые в медвежьем рынке требуют большего внимания, чем в условиях бычьего тренда.

marsbit1 ч. назад

Биткоин-майнеры массово сдаются, но их акции растут

marsbit1 ч. назад

Торговля

Спот
活动图片