Google Deep Think доминирует в восьми языковых олимпиадах, самостоятельно решает 4 нерешенные проблемы, рушит барьеры в науке

marsbitОпубликовано 2026-04-08Обновлено 2026-04-08

Введение

Google DeepMind представила новый ИИ Gemini Deep Think, который показал выдающиеся результаты в восьми международных олимпиадах на разных языках, включая русский. Модель достигла уровня золотых медалистов в математических, физических и химических соревнованиях, а также продемонстрировала мощные способности в программировании. Особенно впечатляющими стали результаты на японском и французском языках, где ИИ набрал 100% баллов. На китайском языке модель показала высокий результат в математической олимпиаде (86,3%), но менее впечатляющий — в программировании (63,3%), что указывает на различия между чистым推理 и практической реализацией кода. Google подчеркивает, что цель проекта —打破语言ковые барьеры в научных исследованиях, позволяя учёным со всего мира использовать ИИ на родном языке. Модель уже помогла решить несколько нерешённых математических проблем и участвовала в написании научных работ. Однако некоторые эксперты отмечают, что результаты пока не имеют независимого подтверждения, и детали тестирования не раскрыты.

«Deep Think превзошел/сравнялся с конкурентами во всех соревнованиях»!

Только что старший исследователь Google DeepMind Conglong Li на платформе X опубликовал 12 постов, представив беспрецедентный отчет об успехах.

Один ИИ, один и тот же «мозг», восемь экзаменов на разных языках, все сданы на высокие баллы.

Для любой модели такие результаты являются исключительными.

От золотой медали IMO до полного охвата региональных олимпиад

Этот успех Deep Think в достижении высоких результатов в различных рейтингах — не внезапная единичная вспышка, а кривая развития способностей, которая формировалась почти год.

Сначала — покорение самого сложного поля логических рассуждений.

В июле 2025 года Gemini Deep Think впервые достиг уровня золотой медали на Международной математической олимпиаде (IMO), набрав 35 баллов из 42. В то же время показал аналогично высокий уровень на финале мирового чемпионата ICPC.

Эти два достижения уже официально опубликованы в блоге DeepMind.

Google DeepMind затем внес эти результаты в официальный блог, обозначив их как знак того, что Deep Think преодолел «порог мировых соревнований» в математике и программировании.

Затем Deep Think начал переход от «чемпионского прорыва в отдельных дисциплинах» к «системной проверке на кросс-языковых, междисциплинарных и разнообразных сценариях».

В феврале 2026 года Google опубликовал три статьи в блоге.

Одна представила саму модель Gemini 3.1 Pro, другая — крупное обновление специального режима рассуждений Deep Think, третья — от команды научных открытий DeepMind, которая напрямую позиционирует Deep Think как «мультипликатор человеческого интеллекта».

Обновленный Deep Think представил ряд жестких показателей:

Humanity's Last Exam — 48.4% (без инструментальной помощи), ARC-AGI-2 — 84.6% (официальная проверка фонда ARC Prize), рейтинг Elo в соревновательном программировании Codeforces — 3455, письменные части Международной физической олимпиады 2025 и Международной химической олимпиады — на уровне золотой медали.

Эта траектория очень четкая: сначала использовать мировые соревнования, такие как IMO и ICPC, чтобы доказать свои мощные способности к рассуждению, а затем использовать результаты многоязыковых, региональных и междисциплинарных олимпиад, чтобы доказать свою универсальную способность к глубоким рассуждениям со стабильным переносом между языками и областями.

Эволюция способностей Gemini Deep Think от золотой медали IMO до ускорения научных исследований уровня PhD

Детальный разбор табеля успеваемости на 8 языках

Теперь давайте подробно рассмотрим этот табель.

Японский язык наиболее яркий.

35-я Японская математическая олимпиада (JMO Finals) 2025 года — идеальный результат.

Азиатский предварительный этап ICPC в Японии — идеальный результат.

При этом результат JMO Finals даже превысил уровень 80% от наивысшего балла в том году, достигнув стандарта, официально называют «эквивалентным золотой медали».

Французский язык также на 100%.

С китайским интереснее.

На 41-й Китайской математической олимпиаде (CMO) Deep Think набрал 86.3%, что очень впечатляюще. Но на Китайской олимпиаде по информатике (NOI) — только 63.3%.

Разрыв между 86.3% и 63.3% очерчивает реальные границы способности ИИ к рассуждению.

В математических олимпиадах модель сталкивается с абстрактными выводами, построением доказательств и многошаговыми умозаключениями, что как раз является сильной стороной Deep Think.

Но в олимпиадах по информатике проблема заключается не только в том, чтобы «понять», но и в переводе логики в исполняемый код, контроле граничных условий, учете ограничений сложности и избежании ошибок на уровне реализации.

Первое ближе к чистым рассуждениям, второе требует одновременного прохождения «рассуждений + проектирования алгоритмов + инженерной реализации».

В результатах олимпиад на других языках — корейском, хинди, вьетнамском, русском, португальском — Deep Think также превзошел конкурентов или, по крайней мере, сравнялся с ними.

Если снова объединить японский, французский и китайский, то最不обычным в этот раз является не то, что какая-то одна дисциплина была сдана на идеальный балл, а то, что одна и та же модель, одна и та же система рассуждений Deep Think, на экзаменационных работах на multiple языках показала результаты уровня первого эшелона.

Насколько надежен этот табель?

Но здесь есть ключевой пробел:

Conglong Li не привел конкретных сравнительных данных конкурентов: все результаты получены из внутреннего тестирования Google. Нет независимого повторения третьей стороной, нет официального подтверждения организаторами олимпиад, методы оценки полностью не раскрыты.

Каждая задача решалась один раз или много раз с выбором лучшего результата? Сколько вычислительных ресурсов было использовано при рассуждении? Было ли вмешательство ручного prompt-инжиниринга?

Эти детали, напрямую влияющие на ценность результатов, также не упомянуты.

Еще один момент, который легко пренебречь: все эти экзамены являются региональными отборочными турами, а не международными финалами.

Между сложностью задач региональных этапов и международных финалов — разница в orders величины.

Исследователь четко сказал, что эти результаты «будут включены в model card», но на момент публикации model card еще не обновлена.

Таким образом, пока это все еще похоже на табель, который ученик сам оценил, сам опубликовал и еще не передал в учебную часть для заверения печатью.

Многоязыковая справедливость в науке — забытое настоящее поле битвы

Почему Google专门 потратил силы на оценку региональных олимпиад на 8 языках?

Текущая оценка способностей ИИ к рассуждению почти полностью основана на английском языке.

MATH, GSM8K, HumanEval, ARC-AGI... все это на английском.

Всем математикам, физикам, инженерам мира, чей родной язык не английский, при использовании научных инструментов ИИ приходится сначала преодолевать языковой барьер.

Google выбрал эти 8 языков не случайно.

Японский, корейский, китайский покрывают важные научные центры Восточной Азии, хинди, вьетнамский — emerging рынки, французский, русский, португальский — Европу и Южную Америку.

Вместе это — большая часть глобального научного производства.

DeepMind в официальном блоге позиционирует Deep Think как «мультипликатор человеческого интеллекта», заявляя, что он может «обрабатывать поиск знаний и строгую проверку, позволяя ученым сосредоточиться на концептуальной глубине и творческом направлении».

В сочетании с этими многоязыковыми результатами, подтекст этих слов понять нетрудно: этот мультипликатор предназначен не только для ученых, говорящих на английском.

Более примечательно то, как далеко Deep Think уже продвинулся в научном применении.

DeepMind представила интеллектуального агента для математических исследований под названием Aletheia, работающего на основе Deep Think, который может автономно генерировать, проверять и修订ить решения исследовательских математических проблем.

Aletheia, управляемый Deep Think, способен к итеративному生成, проверке и исправлению исследовательских математических проблем

Aletheia уже参与 создании нескольких исследовательских статей, одна из которых полностью выполнена ИИ самостоятельно, вычислив specific структурные константы в арифметической геометрии.

Кроме того, в полуавтономной оценке 700 открытых математических проблем он独立 решил 4 ранее нерешенные проблемы.

Режим Gemini Deep Think также показал огромный потенциал в области компьютерных наук, физики, экономики и других областях.

В области компьютерных наук Deep Think помог опровергнуть гипотезу, остававшуюся нерешенной в течение десяти лет, в области физики нашел новое аналитическое решение для гравитационного излучения космических струн, в области экономики расширил теорему теории аукционов.

Схема процесса рассуждений ИИ, показывающая, как крупномасштабное исследование пространства решений на сетевом уровне агрегируется в структурированные рассуждения и подтверждается с помощью автоматизированной и ручной проверки.

Совместно с экспертами, решая 18 исследовательских难题, расширенная версия Gemini Deep Think помогла突破 long-standing bottlenecks в областях алгоритмов, машинного обучения и комбинаторной оптимизации, теории информации以及 экономики.

Это уже далеко выходит за рамки «решения олимпиадных задач».

Пока конкуренты соревнуются в рейтингах английских benchmark'ов, Google уже нашел новое поле битвы в области «ускорителей научных исследований с ИИ».

Самое важное в этом деле — не баллы,真正的 сигнал behind it заключается в том, что языковые барьеры инструментов ИИ для науки решаются как инженерная проблема.

Если этот путь будет пройден, ученые всего мира, ведущие исследования на японском, корейском, китайском, хинди, впервые окажутся на одной стартовой линии с носителями английского языка.

На этот раз Google уже выложил карты на стол.

Что касается того, кто из конкурентов сделает ответный ход,相信 мы скоро это увидим.

Источники:

https://blog.google/intl/ja-jp/company-news/technology/gemini-31-pro-gemini-31-pro-deep-think/%20

https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/%20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

Статья из WeChat Official Account «新智元» (XinZhiYuan), автор: 新智元

Связанные с этим вопросы

QЧто такое Deep Think от Google и каковы его основные достижения?

ADeep Think — это продвинутая система искусственного интеллекта, разработанная Google DeepMind, предназначенная для сложных рассуждений и решения задач. Она продемонстрировала выдающиеся результаты в различных международных олимпиадах, включая золотой уровень на Международной математической олимпиаде (IMO) и высокие показатели в ICPC, а также решила несколько ранее нерешённых научных проблем.

QНа каких языках Deep Think показал высокие результаты в олимпиадах?

ADeep Think продемонстрировал высокие результаты на восьми языках: японском (например, идеальный балл на Japanese Mathematical Olympiad), китайском, французском (100%), корейском, хинди, вьетнамском, русском и португальском. Это включает математические, programming и научные олимпиады.

QКакие научные проблемы решил Deep Think самостоятельно?

ADeep Think автономно решил четыре ранее нерешённые математические задачи из набора из 700 открытых проблем. Кроме того, он помог опровергнуть десятилетнюю гипотезу в computer science, нашёл новые аналитические решения для гравитационного излучения космических струн в физике и расширил теорему в auction theory в экономике.

QНасколько надёжны заявленные результаты Deep Think?

AРезультаты были представлены исследователем Google DeepMind, но пока отсутствует независимая проверка или официальное подтверждение от организаций олимпиад. Детали методики тестирования, использование вычислительных ресурсов и возможное вмешательство человека не раскрыты, что оставляет вопросы о полной достоверности без обновления model card.

QКак Deep Think влияет на научные исследования и многоязычное равенство?

ADeep Think позиционируется как «мультипликатор человеческого интеллекта», способный работать на multiple languages, что снижает языковой барьер в науке. Это позволяет исследователям из неанглоязычных стран (например, Японии, Китая, Индии) использовать ИИ на родном языке, потенциально уровнять их возможности с англоязычными учёными и ускорить глобальные научные открытия.

Похожее

Биткоин: Почему защита уровня $59 тыс. может стать самым серьёзным испытанием для BTC на сегодняшний день

Биткоин (BTC) восстанавливается после месяцев снижения и в настоящее время торгуется около $64 000, отскочив от минимума $57 800 1 июля. Ключевой уровень поддержки находится на отметке $59 000, где сконцентрирована себестоимость позиций для более чем половины всех трейдеров. Отскок от этого уровня рассматривается как защита зоны держателями, однако аналитики указывают, что это может не являться окончательным дном рынка, поскольку поведение краткосрочных держателей остается неоднозначным. Долгосрочные держатели (LTH) в настоящее время не проявляют активных продаж, что подтверждается метрикой Binary CDD, упавшей до нуля. Это является конструктивным сигналом для биткоина. Коэффициент SOPR, измеряющий доходность реализованного объема, составляет 0,89 и медленно растет. Исторически подобные уровни в апреле 2020 и сентябре 2023 годов предшествовали значительным ралли. Устойчивый спрос со стороны инвесторов США через спотовые биткоин-ETF является еще одним ключевым фактором для продолжения роста. В июле чистый приток средств в эти фонды оставался положительным. Для закрепления восходящего тренда биткоину необходимо преодолеть сопротивление в районе $64 336.

ambcrypto57 мин. назад

Биткоин: Почему защита уровня $59 тыс. может стать самым серьёзным испытанием для BTC на сегодняшний день

ambcrypto57 мин. назад

Еженедельный отчет о финансировании | Crypto.com привлекает 400 миллионов долларов, CeFi и стабильные монеты продолжают привлекать капитал

**Краткий обзор финансирования на неделю 13-19 июля 2026 года** Неделя была отмечена значительной концентрацией капитала в криптоиндустрии. Общая сумма привлеченных средств составила более 812 миллионов долларов в рамках 17 сделок. Наибольшие инвестиции получили секторы централизованных финансов (CeFi), стейблкоинов и инфраструктуры. Ключевые события: * **Crypto.com** привлек 400 млн долларов от Citadel Securities, достигнута оценка в 200 миллиардов долларов. * **Alpaca** (API-брокер) собрала 135 млн долларов. * Значительные раунды также состоялись у **Flex** (70 млн долларов, кросс-бордерный банкинг на стейблкоинах), **Velocity** (38 млн долларов, платежная инфраструктура) и **Pact Labs** (7 млн долларов от Tether для интеграции USDT в зарплатные системы). В области **инфраструктуры** выделились: * **ADI Chain** (500 млн долларов на развитие инфраструктуры для стейблкоинов и расчетов). * **Cyclops** (20 млн долларов, платежная инфраструктура на стейблкоинах). * **Glacis Labs** (6.8 млн долларов, многоцепочечный клиринг). В секторе **DeFi** и **Web3+AI** суммы были скромнее, включая 500 млн долларов для **DGrid AI** и 400 млн долларов для **Quote Trade**. Параллельно продолжился сильный приток капитала в **AI и робототехнику**: * **Fireworks** (AI-облачные сервисы) привлекла 15 млрд долларов. * Венчур **Walden Robotics** (гуманоидные роботы) и китайская компания **Climber Dynamics** (также гуманоидные роботы) привлекли 3 млрд и почти 2 млрд долларов соответственно. Также на неделе были отмечены несколько значимых **приобретений**, включая покупку японским SBI Holdings сингапурской биржи Coinhako.

marsbit1 ч. назад

Еженедельный отчет о финансировании | Crypto.com привлекает 400 миллионов долларов, CeFi и стабильные монеты продолжают привлекать капитал

marsbit1 ч. назад

Самое мягкое медвежье дно? Медведи BTC уходят, а ARK и Bitwise единогласно смотрят вверх

20 июля 2026 года рынок криптовалют демонстрирует смешанные сигналы. BTC колеблется около $75 000, ETH откатился до $1900, а альткойны остаются вялыми. Индекс страха находится на уровне 35, указывая на преобладание паники. Тем не менее, появляются признаки потенциального дна. По данным Polymarket, существует 33% вероятность падения BTC ниже $50 000 к концу года. ARK Invest отмечает, что, несмотря на техническую слабость, наблюдается рост доли долгосрочных держателей и поставок в убытке — возможные сигналы истощения продавцов. Bitwise называет текущий спад «структурно самым мягким медвежьим рынком» для BTC, подчеркивая, что минимумы циклов последовательно повышаются благодаря институциональному принятию. Аналитики технического анализа предполагают, что важная зона поддержки сформировалась между $59 000 и $70 000. Точка зрения разнится: одни считают, что низ волны C, возможно, уже сформирован около $57 000, другие предупреждают, что неспособность преодолеть $66 000 повышает риск локального максимума. Значительный торговец Doctor Profit сообщил о закрытии всех коротких позиций и начале поэтапного накопления биткойнов в диапазоне $54 000–$64 000, ссылаясь на структурные улучшения, такие как прогресс в регулировании. Общий консенсус сводится к тому, что, несмотря на сохраняющиеся макроэкономические риски и волатильность, текущая коррекция может быть более умеренной, а институциональное накопление указывает на формирование долгосрочной основы для восстановления.

Foresight News1 ч. назад

Самое мягкое медвежье дно? Медведи BTC уходят, а ARK и Bitwise единогласно смотрят вверх

Foresight News1 ч. назад

Эволюция порядка в эпоху ИИ и Web3: Конкурентные аспекты m&W и пути исследования

Человечество переживает переход от «повышения производительности» к «трансформации производственных отношений». С развитием AI Agent (интеллектуальных агентов) высвобождается беспрецедентный кремниевый производственный потенциал. В будущем все больше задач будут выполнять не отдельные индивиды, а совместные сети людей, AI Agent и мультиагентные системы. Ключевой вопрос: как установить доверительные отношения между незнакомыми людьми и AI Agent для долгосрочного сотрудничества? Как оценивать сложный вклад? Как создать стабильные, справедливые и устойчивые механизмы распределения стоимости между разными субъектами? Web3 заложил основу для децентрализованной экономики, изучая идентичность, активы, организацию и инфраструктуру. Однако в эпоху AI Agent простого решения проблем владения активами и транзакций уже недостаточно. Будущим интеллектуальным сетям нужна новая система порядка, охватывающая идентичность, кредит, сотрудничество и экономические стимулы. m&WDAO, через свою концепцию EcoFi (Экологический Финансы / Экологический Порядок), исследует модель нового порядка для экономики совместной деятельности человека и машины. Она стремится соединить когнитивные активы человека, исполнительные способности AI Agent и экономические механизмы на блокчейне. Конкуренция m&W разворачивается в измерении построения инфраструктуры для будущих интеллектуальных сетей: как в них генерируется доверие, как происходит сотрудничество и как стоимость постоянно фиксируется. В статье анализируются существующие подходы, такие как Colony (коллаборация и управление в DAO), SingularityNET (обмен возможностями ИИ), Gitcoin Passport/Verax (инфраструктура идентичности и репутации), Farcaster и Lens Protocol (открытые социальные сети). Отмечается, что в то время как эти проекты решают важные частные задачи, m&W фокусируется на более фундаментальном вопросе построения доверия и механизмов сотрудничества между людьми и AI Agent. Эволюционный путь m&W представлен в три этапа: 1. **m&W 1.0: Кредитный якорь.** Создание сети высококачественных участников (Builders) через строгий отбор ("столкновение протонов") и превращение их вклада в невозвращаемые кредитные активы (SBT - Soulbound Token). 2. **m&W 2.0: Экономика сотрудничества.** Протокол EcoFi трансформирует кредитные активы в производительность, создавая замкнутую экономическую петлю для проверки, оценки и вознаграждения сложного, неструктурированного вклада с использованием гибридной системы проверки (ИИ + человек + арбитражная сеть). 3. **m&W 3.0: Интеллектуальный порядок.** Создание экономики AI Agent, где долгосрочные проверенные заслуги человека служат кредитной основой для его "цифрового двойника" (AI Agent), что позволяет агентам участвовать в экономической сети как доверенным субъектам. Проект сталкивается с вызовами, включая сложный "холодный старт" из-за высоких требований к участникам, необходимость баланса между автоматизацией ИИ и человеческим суждением, а также построение устойчивой токеномики ($CMW). В заключение, миссия m&W заключается не в создании еще одного рынка AI-услуг, а в исследовании новых производственных отношений для эпохи ИИ. Цель - соединить кредит, основанный на долгосрочном вкладе человека, способности к сотрудничеству AI Agent, механизмы блокчейна и экономические стимулы, чтобы заложить основу для надежного, справедливого и устойчивого порядка в будущих сетях совместной деятельности человека и машины.

链捕手1 ч. назад

Эволюция порядка в эпоху ИИ и Web3: Конкурентные аспекты m&W и пути исследования

链捕手1 ч. назад

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

Поздравляем команду Китая с завоеванием чемпионского титула на 67-й Международной математической олимпиаде (IMO 2026) в Шанхае! Китайская команда, все участники которой получили золотые медали, набрала 232 балла, опередив занявшую второе место команду США на 25 очков. Трое китайских школьников — Дэн Лэянь и Чжан Болунь из Шанхайской средней школы, а также Лю Чэ из Второй средней школы при Восточно-Китайском педагогическом университете — получили золотые медали с идеальным результатом в 42 балла. Это уже 26-я победа Китая в общем зачёте с 1989 года. Впервые IMO проводилась в средней школе — Шанхайской средней школе, чьи ученики в сумме завоевали уже 20 золотых медалей IMO. Особое внимание в этом году привлекло участие ИИ. Сообщается, что GPT-5.6 Pro впервые с первой попытки решил все шесть задач IMO 2026, продемонстрировав потенциал перехода от поиска методом проб и ошибок к точному и безошибочному решению, что ранее считалось исключительной чертой человеческого интеллекта.

marsbit2 ч. назад

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

marsbit2 ч. назад

Торговля

Спот
活动图片