Google Deep Think доминирует в восьми языковых олимпиадах, самостоятельно решает 4 нерешенные проблемы, рушит барьеры в науке

marsbitОпубликовано 2026-04-08Обновлено 2026-04-08

Введение

Google DeepMind представила новый ИИ Gemini Deep Think, который показал выдающиеся результаты в восьми международных олимпиадах на разных языках, включая русский. Модель достигла уровня золотых медалистов в математических, физических и химических соревнованиях, а также продемонстрировала мощные способности в программировании. Особенно впечатляющими стали результаты на японском и французском языках, где ИИ набрал 100% баллов. На китайском языке модель показала высокий результат в математической олимпиаде (86,3%), но менее впечатляющий — в программировании (63,3%), что указывает на различия между чистым推理 и практической реализацией кода. Google подчеркивает, что цель проекта —打破语言ковые барьеры в научных исследованиях, позволяя учёным со всего мира использовать ИИ на родном языке. Модель уже помогла решить несколько нерешённых математических проблем и участвовала в написании научных работ. Однако некоторые эксперты отмечают, что результаты пока не имеют независимого подтверждения, и детали тестирования не раскрыты.

«Deep Think превзошел/сравнялся с конкурентами во всех соревнованиях»!

Только что старший исследователь Google DeepMind Conglong Li на платформе X опубликовал 12 постов, представив беспрецедентный отчет об успехах.

Один ИИ, один и тот же «мозг», восемь экзаменов на разных языках, все сданы на высокие баллы.

Для любой модели такие результаты являются исключительными.

От золотой медали IMO до полного охвата региональных олимпиад

Этот успех Deep Think в достижении высоких результатов в различных рейтингах — не внезапная единичная вспышка, а кривая развития способностей, которая формировалась почти год.

Сначала — покорение самого сложного поля логических рассуждений.

В июле 2025 года Gemini Deep Think впервые достиг уровня золотой медали на Международной математической олимпиаде (IMO), набрав 35 баллов из 42. В то же время показал аналогично высокий уровень на финале мирового чемпионата ICPC.

Эти два достижения уже официально опубликованы в блоге DeepMind.

Google DeepMind затем внес эти результаты в официальный блог, обозначив их как знак того, что Deep Think преодолел «порог мировых соревнований» в математике и программировании.

Затем Deep Think начал переход от «чемпионского прорыва в отдельных дисциплинах» к «системной проверке на кросс-языковых, междисциплинарных и разнообразных сценариях».

В феврале 2026 года Google опубликовал три статьи в блоге.

Одна представила саму модель Gemini 3.1 Pro, другая — крупное обновление специального режима рассуждений Deep Think, третья — от команды научных открытий DeepMind, которая напрямую позиционирует Deep Think как «мультипликатор человеческого интеллекта».

Обновленный Deep Think представил ряд жестких показателей:

Humanity's Last Exam — 48.4% (без инструментальной помощи), ARC-AGI-2 — 84.6% (официальная проверка фонда ARC Prize), рейтинг Elo в соревновательном программировании Codeforces — 3455, письменные части Международной физической олимпиады 2025 и Международной химической олимпиады — на уровне золотой медали.

Эта траектория очень четкая: сначала использовать мировые соревнования, такие как IMO и ICPC, чтобы доказать свои мощные способности к рассуждению, а затем использовать результаты многоязыковых, региональных и междисциплинарных олимпиад, чтобы доказать свою универсальную способность к глубоким рассуждениям со стабильным переносом между языками и областями.

Эволюция способностей Gemini Deep Think от золотой медали IMO до ускорения научных исследований уровня PhD

Детальный разбор табеля успеваемости на 8 языках

Теперь давайте подробно рассмотрим этот табель.

Японский язык наиболее яркий.

35-я Японская математическая олимпиада (JMO Finals) 2025 года — идеальный результат.

Азиатский предварительный этап ICPC в Японии — идеальный результат.

При этом результат JMO Finals даже превысил уровень 80% от наивысшего балла в том году, достигнув стандарта, официально называют «эквивалентным золотой медали».

Французский язык также на 100%.

С китайским интереснее.

На 41-й Китайской математической олимпиаде (CMO) Deep Think набрал 86.3%, что очень впечатляюще. Но на Китайской олимпиаде по информатике (NOI) — только 63.3%.

Разрыв между 86.3% и 63.3% очерчивает реальные границы способности ИИ к рассуждению.

В математических олимпиадах модель сталкивается с абстрактными выводами, построением доказательств и многошаговыми умозаключениями, что как раз является сильной стороной Deep Think.

Но в олимпиадах по информатике проблема заключается не только в том, чтобы «понять», но и в переводе логики в исполняемый код, контроле граничных условий, учете ограничений сложности и избежании ошибок на уровне реализации.

Первое ближе к чистым рассуждениям, второе требует одновременного прохождения «рассуждений + проектирования алгоритмов + инженерной реализации».

В результатах олимпиад на других языках — корейском, хинди, вьетнамском, русском, португальском — Deep Think также превзошел конкурентов или, по крайней мере, сравнялся с ними.

Если снова объединить японский, французский и китайский, то最不обычным в этот раз является не то, что какая-то одна дисциплина была сдана на идеальный балл, а то, что одна и та же модель, одна и та же система рассуждений Deep Think, на экзаменационных работах на multiple языках показала результаты уровня первого эшелона.

Насколько надежен этот табель?

Но здесь есть ключевой пробел:

Conglong Li не привел конкретных сравнительных данных конкурентов: все результаты получены из внутреннего тестирования Google. Нет независимого повторения третьей стороной, нет официального подтверждения организаторами олимпиад, методы оценки полностью не раскрыты.

Каждая задача решалась один раз или много раз с выбором лучшего результата? Сколько вычислительных ресурсов было использовано при рассуждении? Было ли вмешательство ручного prompt-инжиниринга?

Эти детали, напрямую влияющие на ценность результатов, также не упомянуты.

Еще один момент, который легко пренебречь: все эти экзамены являются региональными отборочными турами, а не международными финалами.

Между сложностью задач региональных этапов и международных финалов — разница в orders величины.

Исследователь четко сказал, что эти результаты «будут включены в model card», но на момент публикации model card еще не обновлена.

Таким образом, пока это все еще похоже на табель, который ученик сам оценил, сам опубликовал и еще не передал в учебную часть для заверения печатью.

Многоязыковая справедливость в науке — забытое настоящее поле битвы

Почему Google专门 потратил силы на оценку региональных олимпиад на 8 языках?

Текущая оценка способностей ИИ к рассуждению почти полностью основана на английском языке.

MATH, GSM8K, HumanEval, ARC-AGI... все это на английском.

Всем математикам, физикам, инженерам мира, чей родной язык не английский, при использовании научных инструментов ИИ приходится сначала преодолевать языковой барьер.

Google выбрал эти 8 языков не случайно.

Японский, корейский, китайский покрывают важные научные центры Восточной Азии, хинди, вьетнамский — emerging рынки, французский, русский, португальский — Европу и Южную Америку.

Вместе это — большая часть глобального научного производства.

DeepMind в официальном блоге позиционирует Deep Think как «мультипликатор человеческого интеллекта», заявляя, что он может «обрабатывать поиск знаний и строгую проверку, позволяя ученым сосредоточиться на концептуальной глубине и творческом направлении».

В сочетании с этими многоязыковыми результатами, подтекст этих слов понять нетрудно: этот мультипликатор предназначен не только для ученых, говорящих на английском.

Более примечательно то, как далеко Deep Think уже продвинулся в научном применении.

DeepMind представила интеллектуального агента для математических исследований под названием Aletheia, работающего на основе Deep Think, который может автономно генерировать, проверять и修订ить решения исследовательских математических проблем.

Aletheia, управляемый Deep Think, способен к итеративному生成, проверке и исправлению исследовательских математических проблем

Aletheia уже参与 создании нескольких исследовательских статей, одна из которых полностью выполнена ИИ самостоятельно, вычислив specific структурные константы в арифметической геометрии.

Кроме того, в полуавтономной оценке 700 открытых математических проблем он独立 решил 4 ранее нерешенные проблемы.

Режим Gemini Deep Think также показал огромный потенциал в области компьютерных наук, физики, экономики и других областях.

В области компьютерных наук Deep Think помог опровергнуть гипотезу, остававшуюся нерешенной в течение десяти лет, в области физики нашел новое аналитическое решение для гравитационного излучения космических струн, в области экономики расширил теорему теории аукционов.

Схема процесса рассуждений ИИ, показывающая, как крупномасштабное исследование пространства решений на сетевом уровне агрегируется в структурированные рассуждения и подтверждается с помощью автоматизированной и ручной проверки.

Совместно с экспертами, решая 18 исследовательских难题, расширенная версия Gemini Deep Think помогла突破 long-standing bottlenecks в областях алгоритмов, машинного обучения и комбинаторной оптимизации, теории информации以及 экономики.

Это уже далеко выходит за рамки «решения олимпиадных задач».

Пока конкуренты соревнуются в рейтингах английских benchmark'ов, Google уже нашел новое поле битвы в области «ускорителей научных исследований с ИИ».

Самое важное в этом деле — не баллы,真正的 сигнал behind it заключается в том, что языковые барьеры инструментов ИИ для науки решаются как инженерная проблема.

Если этот путь будет пройден, ученые всего мира, ведущие исследования на японском, корейском, китайском, хинди, впервые окажутся на одной стартовой линии с носителями английского языка.

На этот раз Google уже выложил карты на стол.

Что касается того, кто из конкурентов сделает ответный ход,相信 мы скоро это увидим.

Источники:

https://blog.google/intl/ja-jp/company-news/technology/gemini-31-pro-gemini-31-pro-deep-think/%20

https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

Статья из WeChat Official Account «新智元» (XinZhiYuan), автор: 新智元

Связанные с этим вопросы

QЧто такое Deep Think от Google и каковы его основные достижения?

ADeep Think — это продвинутая система искусственного интеллекта, разработанная Google DeepMind, предназначенная для сложных рассуждений и решения задач. Она продемонстрировала выдающиеся результаты в различных международных олимпиадах, включая золотой уровень на Международной математической олимпиаде (IMO) и высокие показатели в ICPC, а также решила несколько ранее нерешённых научных проблем.

QНа каких языках Deep Think показал высокие результаты в олимпиадах?

ADeep Think продемонстрировал высокие результаты на восьми языках: японском (например, идеальный балл на Japanese Mathematical Olympiad), китайском, французском (100%), корейском, хинди, вьетнамском, русском и португальском. Это включает математические, programming и научные олимпиады.

QКакие научные проблемы решил Deep Think самостоятельно?

ADeep Think автономно решил четыре ранее нерешённые математические задачи из набора из 700 открытых проблем. Кроме того, он помог опровергнуть десятилетнюю гипотезу в computer science, нашёл новые аналитические решения для гравитационного излучения космических струн в физике и расширил теорему в auction theory в экономике.

QНасколько надёжны заявленные результаты Deep Think?

AРезультаты были представлены исследователем Google DeepMind, но пока отсутствует независимая проверка или официальное подтверждение от организаций олимпиад. Детали методики тестирования, использование вычислительных ресурсов и возможное вмешательство человека не раскрыты, что оставляет вопросы о полной достоверности без обновления model card.

QКак Deep Think влияет на научные исследования и многоязычное равенство?

ADeep Think позиционируется как «мультипликатор человеческого интеллекта», способный работать на multiple languages, что снижает языковой барьер в науке. Это позволяет исследователям из неанглоязычных стран (например, Японии, Китая, Индии) использовать ИИ на родном языке, потенциально уровнять их возможности с англоязычными учёными и ускорить глобальные научные открытия.

Похожее

Время давления для Base

**Давление на Base: проблемы децентрализации и растущая конкуренция** Соучредитель Base Джесси Поллак публично признал стратегические ошибки: ставка на социальные и креаторские токены в последний год не привела к устойчивому внедрению. Теперь Base фокусируется на токенизации акций при поддержке Coinbase, отставая от нового конкурента — Robinhood Chain. Несмотря на лидерство Base среди L2 (кроме BNB Chain) с TVL почти в $12 млрд, его централизованное управление стало критической проблемой. Такие инциденты, как сбои в производстве блоков и возможное понижение рейтинга децентрализации L2BEAT до Stage 0, подрывают доверие. На этом фоне быстрое внедрение и рост Robinhood Chain, включая объем DEX, выглядят особенно контрастно. Дополнительный удар по репутации нанес основатель Coinbase Брайан Армстронг: смена его аватара спровоцировала спекулятивный скачок мем-токена BRAIN и последующий обвал, что вызвало волну критики в сообществе. Хотя миссия Base — долгосрочная финансовая инфраструктура, а не краткосрочные спекуляции, появление сильного конкурента обнажило хронические проблемы. Чтобы сохранить позиции в области RWA и машинных платежей, Base необходимо срочно решать вопросы децентрализации и укреплять доверие пользователей.

Foresight News10 мин. назад

Время давления для Base

Foresight News10 мин. назад

Уступка Белого дома расчищает путь для этических норм: успеет ли Закон о ясности (Clarity Act) пройти до летних каникул Конгресса?

Белый дом пошел на уступки по этическим положениям, что может устранить последнее препятствие для принятия «Закона о ясности» (Clarity Act) — ключевого законопроекта о регулировании рынка цифровых активов в США. Согласно информации от источников в отрасли, администрация Трампа согласилась включить в текст закона положения об этике, регулирующие возможные конфликты интересов госчиновников в криптосфере. Текст уже передан некоторым республиканским сенаторам. Одновременно появился позитивный сигнал: Патрик Уитт, исполнительный директор консультативного совета Белого дома по цифровым активам, останется на посту, чтобы помочь продвижению закона, отложив свои военные обязанности. «Закон о ясности» призван создать единые федеральные правила для рынка цифровых активов, четко разграничив полномочия между Комиссией по ценным бумагам и биржам (SEC) и Комиссией по торговле товарными фьючерсами (CFTC), а также определив правовой статус различных активов, таких как цифровые товары, инвестиционные контракты и стейблкоины. До летних каникул Конгресса (середина августа) осталось всего несколько рабочих дней. Если разногласия по этическим вопросам будут урегулированы в ближайшие недели, законопроект имеет шанс на прорыв. В противном случае его рассмотрение может быть отложено на неопределенный срок. Принятие «Закона о ясности» станет историческим поворотным моментом, способным снизить нормативную неопределенность в США и заложить основу для прихода традиционных финансовых институтов в отрасль.

Odaily星球日报15 мин. назад

Уступка Белого дома расчищает путь для этических норм: успеет ли Закон о ясности (Clarity Act) пройти до летних каникул Конгресса?

Odaily星球日报15 мин. назад

Взлом 515 миллионов NIGHT в сети Midnight обвалил токен на 32% – Удержит ли $0,015?

В 2026 году крипторынок столкнулся с ростом хакерских атак. В июле было похищено более $59 млн, а общая сумма убытков с начала года достигла $1 млрд. Среди последних инцидентов — эксплуатация кросс-чейн моста сети Midnight, в результате которой из контракта, содержащего 515 миллионов токенов NIGHT, были выведены все средства. Атакующий продал около 290 миллионов NIGHT через DEX на Cardano, что привело к падению цены токена на 32% до исторического минимума в $0.015. После незначительного восстановления до $0.019 токен остается под сильным давлением продаж. Рыночная капитализация NIGHT упала на 27%, в то время как объем торгов вырос на 829%. Индикатор RSI вошел в зону перепроданности (уровень 17), что свидетельствует о доминировании медвежьего настроения. Основа Midnight заявила, что сама сеть осталась безопасной, а инцидент был изолирован в рамках кросс-чейн операций. Прогнозируется, что при сохранении негативных настроений токен может удерживаться ниже $0.02 с поддержкой на уровне $0.015.

ambcrypto19 мин. назад

Взлом 515 миллионов NIGHT в сети Midnight обвалил токен на 32% – Удержит ли $0,015?

ambcrypto19 мин. назад

Флагман в мире крипто-акций | Резервы наличных в Strategy выросли до 3,23 миллиарда долларов, покупки BTC приостановлены; Vanguard и другие управляющие активы увеличили свои доли в Strategy (21 июля)

Обзор рынка: Риски и возможности на фоне повышенной волатильности Рынки акций, включая корейские, американские и китайские (A-shares), переживают период высокой волатильности из-за ожиданий дальнейшего повышения процентных ставок ФРС, геополитической напряженности (ситуация вокруг США и Ирана) и процесса "очистки" от избыточного кредитного плеча. Инвесторам рекомендуется соблюдать осторожность и избегать использования маржинального кредитования. На американском рынке растут короткие позиции против акций, связанных с искусственным интеллектом (ИИ), достигнув максимумов с 2010 года, что отражает опасения по поводу "пузыря ИИ". Технологические акции, особенно полупроводниковые, значительно снизились. В секторе криптоактивов: * Ключевая компания, держащая биткоин в казначействе, **Strategy (MSTR)**, увеличила свои денежные резервы до 32,3 млрд долларов и приостановила покупки BTC. При этом крупные институциональные инвесторы, такие как Vanguard Group и Capital Group, наращивают свои доли в акциях Strategy. * Глобальные публичные компании (исключая майнинговые) на прошлой неделе приобрели биткоинов на сумму всего 1,33 млн долларов, что на 98,4% меньше неделей ранее. Их совокупные холдинги BTC составляют около 1,14 млн монет. * Другие компании, такие как Bitcoin Japan Corporation и ORANGE JUICE, привлекают финансирование для включения биткоина в свои казначейские активы. * Компания **BitMine**, фокусирующаяся на Ethereum, увеличила свои холдинги ETH до 5,78 млн монет (около 4,8% от предложения) и сообщила о совокупных активах (крипто, деньги, ценные бумаги) в 11,5 млрд долларов. Вывод: Фондовые рынки находятся в режиме коррекции и снижения кредитного плеча. В криптосекторе наблюдается осторожность среди компаний-держателей биткоина, в то время как институциональный интерес к ним как к активам растет. Компании, ориентированные на Ethereum, продолжают накапливать актив.

marsbit26 мин. назад

Флагман в мире крипто-акций | Резервы наличных в Strategy выросли до 3,23 миллиарда долларов, покупки BTC приостановлены; Vanguard и другие управляющие активы увеличили свои доли в Strategy (21 июля)

marsbit26 мин. назад

Прозрачность резервов, создаваемая посредством непрерывной работы: Matrixdock отмечает два года независимой верификации

Matrixdock завершил свой четвертый последовательный полугодовой независимый аудит резервов, проведенный Bureau Veritas. Впервые аудит охватил не только токенизированный золотой продукт (XAUm), но и токенизированный серебряный продукт (XAGm), что отражает стремление компании создавать резервные активы, вызывающие доверие у институциональных партнеров. За два года непрерывных проверок одним и тем же независимым аудитором был установлен последовательный процесс верификации. В ходе июльского аудита на трех объектах институциональных хранилищ было физически проверено 574 слитка золота и серебра от аффинажных предприятий, аккредитованных LBMA. Проверка подтвердила соответствие резервов количеству токенов в обращении: 508 золотых слитков (около $66,09 млн) и 66 серебряных слитков (около $4,04 млн). Прозрачность резервов в Matrixdock обеспечивается несколькими уровнями: помимо полугодовых аудитов, держатели могут проверять ежемесячные отчеты, ончейн-подтверждение резервов и инструмент Gold Allocation Lookup для прямой проверки обеспечения. Такой подход создает постоянную, а не периодическую проверку. Непрерывная верификация обеспечения — это основа для использования токенизированных резервных активов в качестве надежного залога, в казначейском управлении и расчетах в рамках ончейн-финансов. Регулярные аудиты отражают долгосрочные обязательства Matrixdock по созданию надежного Резервного Слоя для финансовых операций в блокчейне.

TheNewsCrypto53 мин. назад

Прозрачность резервов, создаваемая посредством непрерывной работы: Matrixdock отмечает два года независимой верификации

TheNewsCrypto53 мин. назад

Торговля

Спот
活动图片