Новая работа лауреата премии Тьюринга Саттона: Использование формулы 1967 года для устранения важного недостатка потокового обучения с подкреплением

marsbitОпубликовано 2026-05-10Обновлено 2026-05-10

Введение

В декабре 2024 года исследователи из Университета Альберты столкнулись с проблемой «потокового барьера» в глубоком обучении с подкреплением: при обучении в потоковом режиме (без буфера воспроизведения и с размером пакета, равным 1) обучение становилось нестабильным. Год спустя, команда с участием лауреата премии Тьюринга Ричарда Саттона предложила решение — метод «интенциональных обновлений» (Intentional Updates). Идея, восходящая к алгоритму NLMS 1967 года, заключается в том, чтобы напрямую задавать желаемое изменение выхода функции (например, уменьшение ошибки прогноза на фиксированный процент), а затем вычислять необходимый размер шага обновления параметров, а не наоборот. Этот подход обеспечивает стабильное влияние каждого обновления на результат. Метод был применён как к обучению ценности (Intentional TD/Q), так и к обучению политики (Intentional Policy Gradient), сочетаясь с такими техниками, как RMSProp и следы пригодности. В экспериментах на задачах непрерывного (MuJoCo) и дискретного (Atari) управления алгоритмы показали производительность, сопоставимую с современными методами (SAC, DQN), использующими большие буферы, но при значительно меньших вычислительных затратах и с лучшей устойчивостью. Хотя метод демонстрирует высокую эффективность и робастность, авторы отмечают потенциальную проблему смещения в обновлениях политики и необходимость дальнейшей работы для её устранения. «Интенциональные обновления» представляют собой значительный шаг в сторону создания ИИ, с...

В конце 2024 года научное сообщество широко обсуждало статью под названием «Потоковое глубокое обучение с подкреплением, наконец, заработало» (arXiv:2410.14606). Авторы из команды Махмуда из Университета Альберты посвятили значительную часть описанию неловкой реальности: обучение с подкреплением, как метод, по своей сути предназначенный для «обучения на ходу», почти не может этого делать в эпоху глубоких нейронных сетей. Стоит убрать буфер воспроизведения или установить размер пакета равным 1, как обучение разваливается. Они назвали это «потоковым барьером» (stream barrier).

В той статье алгоритмы серии StreamX, благодаря тщательно подобранным гиперпараметрам, разреженной инициализации и различным методам стабилизации, едва преодолели эту стену.

Однако менее чем через полтора года член той же исследовательской группы вместе с коллабораторами из института Openmind дал совершенно другой ответ: корень потокового барьера не в «недостатке данных», а в «неправильной единице измерения шага обучения».

Название статьи: Intentional Updates for Streaming Reinforcement Learning

Адрес статьи: https://arxiv.org/pdf/2604.19033v1

Репозиторий кода: https://github.com/sharifnassab/Intentional_RL

Одна педаль газа, и большая яма

Представьте, что вы учитесь парковать машину. Инструктор говорит вам каждый раз «давить на газ 0.1 секунды». Проблема в том, что при одинаковом времени в 0.1 секунды машина проедет разное расстояние в зависимости от подъема, спуска, нагрузки и т.д. Иногда не хватит сантиметра, иногда переедет на 30 см и врежется в стену.

Шаг обучения в традиционном градиентном спуске делает именно это: он определяет, насколько параметры должны измениться, но никак не контролирует, насколько изменится выход функции. При обучении пакетами (batch) усреднение ошибок по сотням или тысячам примеров сглаживает крайние случаи, и проблема не так заметна. Но в «потоковой» среде на каждом шаге есть только один пример, усреднять нечего. Как только направление градиента становится нестабильным, величина обновления начинает сильно колебаться — сегодня сдвиг на 30 см вперед, завтра на 50 см назад — процесс обучения разрушается из-за сильных колебаний.

Это явление «перелета и недолета» (overshooting and undershooting) особенно серьезно в обучении с подкреплением, потому что градиент на каждом временном шаге различается не только по величине, но и быстро меняется по направлению.

Переопределение «какой должна быть одна итерация»

В недавней статье Арсалана Шарифнассаба из института Openmind, Мохамеда Эльсаида, А. Рупама Махмуда и Ричарда Саттона из Университета Альберты предложен подход, который меняет угол зрения: вместо того чтобы указывать, насколько должны измениться параметры, лучше прямо указать, насколько должен измениться выход функции.

Эта идея возникла не на пустом месте. В 1967 году японские ученые Нагумо и Нода в статье «A learning method for system identification» в области адаптивной фильтрации предложили алгоритм «нормализованного метода наименьших квадратов» (NLMS); по сути, он тоже использовал ожидаемое изменение выхода для обратного расчета шага, а не наоборот. Просто этот алгоритм был применим только к простым линейным сценариям.

Исследователи распространили эту идею на глубокое обучение с подкреплением. Они назвали это «целенаправленными обновлениями» (Intentional Updates): перед каждым обновлением сначала определяется «чего я хочу достичь на этом шаге», а затем обратным расчетом определяется, каким должен быть размер шага.

Для обучения оценке ценности (т.е. предсказанию будущего вознаграждения) их «цель» определяется так: после каждого обновления ошибка предсказания ценности текущего состояния должна уменьшаться на фиксированную долю — например, на 5%, не больше и не меньше. Для обучения стратегии (т.е. оптимизации принимаемых решений) их цель определяется так: вероятность выбора текущего действия на каждом шаге может измениться только на «умеренную» величину.

Возвращаясь к аналогии с вождением: это как если бы водитель перед каждым действием решал «я хочу сдвинуть машину вперед на 20 см», а затем автоматически вычислял, насколько нужно нажать на газ в зависимости от текущих условий (уклон, нагрузка), вместо того чтобы каждый раз давить на педаль с одинаковой силой и надеяться на лучшее.

Лауреат премии Тьюринга и его пазл

Одним из авторов статьи является Ричард С. Саттон — лауреат премии Тьюринга 2024 года, широко известный как «отец современного обучения с подкреплением».

Положение Саттона в научном мире примерно соответствует положению Фейнмана в физике: он не только предложил два фундаментальных каркаса современного обучения с подкреплением — обучение с временной разницей (TD learning) и градиент стратегии (policy gradient), но и вместе с Эндрю Барто написал самый авторитетный учебник по этой области «Reinforcement Learning: An Introduction» (сейчас вышло второе издание, доступное для бесплатного чтения онлайн). Он и Барто разделили премию Тьюринга 2024 года, в формулировке которой отмечается «заложение концептуальных и алгоритмических основ обучения с подкреплением».

Получив награду, Саттон не ушел на покой, а вложил призовые деньги в созданный им институт Openmind, финансируя молодых исследователей, желающих изучать фундаментальные вопросы «в среде, свободной от коммерческого давления». Эта новая статья — продукт именно этой некоммерческой организации.

А первый автор, Шарифнассаб, недавно опубликовал на ICML 2025 фреймворк MetaOptimize, исследующий автоматическую онлайн-настройку скорости обучения. Оба проекта сосредоточены на одной задаче: как сделать сам шаг обучения более интеллектуальным.

Детали алгоритма: проще, чем кажется

Математический вывод «целенаправленных обновлений» не сложен, его основную формулу можно описать одной фразой: шаг равен «ожидаемому изменению выхода», деленному на «фактическое влияние направления градиента на выход».

При обучении оценке ценности это «фактическое влияние» — это норма вектора градиента (эквивалент измерения «крутизны» текущей области параметров): в более крутых местах шаг меньше, в более пологих — больше, что гарантирует постоянное воздействие каждого обновления на функцию ценности.

При обучении стратегии «ожидаемое изменение» определяется пропорциональным функции преимущества: насколько текущее действие лучше среднего уровня, настолько стратегия и сдвигается в этом направлении — с нормализацией величины с помощью скользящего среднего, что обеспечивает стабильность изменения стратегии в долгосрочной перспективе в объяснимых пределах.

Исследователи также объединили эту основную идею с двумя инженерными практиками: диагональным масштабированием в стиле RMSProp (для обработки различий в масштабах разных параметров) и следами пригодности (eligibility traces, помогающими распространять сигнал вознаграждения на предыдущие временные шаги).

В итоге получились три полных алгоритма: для предсказания ценности — Intentional TD (λ), для управления с дискретными действиями — Intentional Q (λ) и для непрерывного управления — Intentional Policy Gradient.

Результаты экспериментов: без GPU, наравне с SAC

Статья оценивает этот подход на нескольких стандартных бенчмарках, и результаты впечатляют.

В задачах непрерывного управления MuJoCo (включая сложных симулированных роботов, таких как Ant, Humanoid, HalfCheetah) новый метод Intentional AC в потоковой настройке (размер пакета = 1, без буфера воспроизведения) по конечной производительности многократно приближался или даже превосходил SAC — алгоритм, использующий большой буфер воспроизведения и являющийся практически золотым стандартом для текущих задач непрерывного управления. Что касается вычислительных затрат, количество операций с плавающей запятой, необходимое для одного обновления Intentional AC, составляет примерно 1/140 от одного обновления SAC.

В играх с дискретными действиями Atari и MinAtar Intentional Q-learning показал результаты, сравнимые с DQN, использующим буфер воспроизведения, причем для всех задач использовались одни и те же гиперпараметры без индивидуальной настройки.

Исследователи также специально проверили, достигается ли на самом деле «цель»: они измерили отношение фактического изменения к ожидаемому. В упрощенной настройке без следов пригодности стандартное отклонение этого отношения составило всего от 0.016 до 0.029, 99-й процентиль — в пределах 1.07; это означает, что в подавляющем большинстве случаев обновление действительно делало «ровно то, что планировалось».

Кроме того, набор экспериментов по удалению компонентов показал, что если убрать нормализацию RMSProp или σ-член, производительность снижается, но остается конкурентоспособной, причем само «целенаправленное масштабирование» является основным вкладом, а другие компоненты — вспомогательными.

Проблемы все же есть

Фреймворк «целенаправленных обновлений» также продемонстрировал явные преимущества в устойчивости. Когда исследователи последовательно убирали различные вспомогательные методы стабилизации, от которых зависит метод StreamX (разреженная инициализация, масштабирование вознаграждения, нормализация входных данных, LayerNorm), снижение производительности Intentional AC было значительно меньше, чем у оригинального StreamAC, что указывает на то, что целенаправленное масштабирование уменьшает зависимость от внешних «костылей» на фундаментальном уровне.

Однако в статье также честно признается одна проблема, которая еще не полностью решена: при обучении стратегии шаг зависит от текущего выбранного действия, что может неявно присваивать разный «вес» разным действиям, потенциально меняя ожидаемое направление градиента стратегии. В задачах Humanoid и HumanoidStandup, измеряя косинусное сходство ожидаемого направления обновления, исследователи обнаружили, что это смещение на ключевых этапах обучения близко к 0.96 (почти не влияет); но в Ant-v4 согласованность упала до медианного значения 0.63, что указывает на то, что проблемой нельзя всегда пренебрегать.

Авторы отмечают, что будущие исследования должны искать стратегии выбора шага, независимые от действия, чтобы «цель» оставалась несмещенной и в математическом ожидании. Это четкое задание для последователей в этом направлении.

Заключение: Пусть ИИ учится на ходу, как человек

Текущая преобладающая парадигма обучения больших моделей зависит от пакетной обработки огромных объемов данных: «скормить» все тексты и код из интернета, многократно итерации, в итоге возникает удивительная способность. Этот путь доказал свою эффективность, но он принципиально является «сначала выучить, потом использовать»: после завершения обучения модель замораживается и не может непрерывно обновляться на основе каждого последующего реального взаимодействия.

Потоковое обучение с подкреплением стремится к совершенно другому режиму обучения: не зависеть от массивного воспроизведения, не зависеть от огромных кластеров GPU, каждое переживание немедленно преобразуется в обновление параметров, непрерывно, дешево, адаптивно. Это больше похоже на реальный способ обучения людей и животных.

От первоначального прорыва Эльсаида и др. в 2024 году «наконец заработало» до принципа «целенаправленных обновлений», предложенного в этой статье, потоковое глубокое обучение с подкреплением развивается с удивительной скоростью. Оно не заменит большие модели, обученные пакетным методом, но для роботов, периферийных устройств, требующих долгосрочной онлайн-адаптации, и любых сценариев, где невозможно поддерживать большие буферы воспроизведения и кластеры GPU, этот путь становится все более убедительным.

Шаг обучения — это не просто гиперпараметр, это обещание ИИ «сколько сделать» на каждом шаге. Когда это обещание наконец стало контролируемым, само обучение стабилизировалось.

Эта статья взята из официального аккаунта WeChat «机器之心» (ID: almosthuman2014), автор: 关注RL的

Связанные с этим вопросы

QЧто такое «потоковый барьер» (stream barrier) в контексте глубокого обучения с подкреплением?

A«Потоковый барьер» — это термин, введённый командой Махмуда в 2024 году для описания проблемы, когда глубокое обучение с подкреплением (RL), которое по своей природе должно обучаться «на ходу» (в потоковом режиме), не может этого сделать без использования буфера воспроизведения (replay buffer) и пакетов данных большого размера. Если убрать буфер воспроизведения и установить размер пакета равным 1, процесс обучения становится нестабильным и «рушится».

QВ чём заключается основная идея «интенциональных обновлений» (Intentional Updates), предложенных в статье?

AОсновная идея «интенциональных обновлений» заключается в том, чтобы изменить принцип выбора размера шага (learning rate) обновления параметров. Вместо того чтобы заранее фиксировать, на сколько изменить параметры (традиционный подход), предлагается сначала определить «намерение» — насколько должна измениться выходная функция модели (например, предсказание ценности или вероятность выбора действия), а затем рассчитать, какой размер шага параметров необходим для достижения именно этого изменения выхода. Это делает процесс обучения более стабильным.

QКакое историческое открытие вдохновило авторов на создание метода «интенциональных обновлений»?

AАвторы вдохновлялись алгоритмом «нормализованного метода наименьших средних квадратов» (NLMS), который был предложен японскими учёными Нагумо и Нода в 1967 году для задач адаптивной фильтрации и идентификации систем. Суть NLMS также заключается в выборе шага обучения на основе желаемого изменения выходного сигнала, а не наоборот. Авторы распространили эту идею на глубокое обучение с подкреплением.

QКакой ключевой результат показали эксперименты с методом Intentional AC в задачах непрерывного управления (например, MuJoCo)?

AЭксперименты показали, что алгоритм Intentional AC в потоковом режиме (размер пакета = 1, без буфера воспроизведения) достигает конечной производительности, сравнимой с современным алгоритмом SAC (Soft Actor-Critic), который использует большие пакеты данных и буфер воспроизведения. При этом одно обновление Intentional AC требует примерно в 140 раз меньше вычислительных операций (FLOPs), чем одно обновление SAC.

QКакой основной недостаток или нерешённая проблема остаётся у предложенного метода, особенно в обучении стратегии (policy learning)?

AОсновная нерешённая проблема заключается в обучении стратегии (policy). Размер шага (learning rate) зависит от конкретного действия, выбранного в данный момент времени (путём сэмплирования). Это может неявно присваивать разным действиям разный «вес» и смещать ожидаемое направление градиента политики. В некоторых задачах (например, Ant-v4) это смещение может быть значительным (косинусное сходство ожидаемого направления падает до 0.63). Авторы отмечают необходимость в будущих исследованиях найти способ выбора шага, независимого от действия, чтобы сделать обновления «интенциональными» и несмещёнными в математическом ожидании.

Похожее

Биткоин: Почему защита уровня $59 тыс. может стать самым серьёзным испытанием для BTC на сегодняшний день

Биткоин (BTC) восстанавливается после месяцев снижения и в настоящее время торгуется около $64 000, отскочив от минимума $57 800 1 июля. Ключевой уровень поддержки находится на отметке $59 000, где сконцентрирована себестоимость позиций для более чем половины всех трейдеров. Отскок от этого уровня рассматривается как защита зоны держателями, однако аналитики указывают, что это может не являться окончательным дном рынка, поскольку поведение краткосрочных держателей остается неоднозначным. Долгосрочные держатели (LTH) в настоящее время не проявляют активных продаж, что подтверждается метрикой Binary CDD, упавшей до нуля. Это является конструктивным сигналом для биткоина. Коэффициент SOPR, измеряющий доходность реализованного объема, составляет 0,89 и медленно растет. Исторически подобные уровни в апреле 2020 и сентябре 2023 годов предшествовали значительным ралли. Устойчивый спрос со стороны инвесторов США через спотовые биткоин-ETF является еще одним ключевым фактором для продолжения роста. В июле чистый приток средств в эти фонды оставался положительным. Для закрепления восходящего тренда биткоину необходимо преодолеть сопротивление в районе $64 336.

ambcrypto46 мин. назад

Биткоин: Почему защита уровня $59 тыс. может стать самым серьёзным испытанием для BTC на сегодняшний день

ambcrypto46 мин. назад

Еженедельный отчет о финансировании | Crypto.com привлекает 400 миллионов долларов, CeFi и стабильные монеты продолжают привлекать капитал

**Краткий обзор финансирования на неделю 13-19 июля 2026 года** Неделя была отмечена значительной концентрацией капитала в криптоиндустрии. Общая сумма привлеченных средств составила более 812 миллионов долларов в рамках 17 сделок. Наибольшие инвестиции получили секторы централизованных финансов (CeFi), стейблкоинов и инфраструктуры. Ключевые события: * **Crypto.com** привлек 400 млн долларов от Citadel Securities, достигнута оценка в 200 миллиардов долларов. * **Alpaca** (API-брокер) собрала 135 млн долларов. * Значительные раунды также состоялись у **Flex** (70 млн долларов, кросс-бордерный банкинг на стейблкоинах), **Velocity** (38 млн долларов, платежная инфраструктура) и **Pact Labs** (7 млн долларов от Tether для интеграции USDT в зарплатные системы). В области **инфраструктуры** выделились: * **ADI Chain** (500 млн долларов на развитие инфраструктуры для стейблкоинов и расчетов). * **Cyclops** (20 млн долларов, платежная инфраструктура на стейблкоинах). * **Glacis Labs** (6.8 млн долларов, многоцепочечный клиринг). В секторе **DeFi** и **Web3+AI** суммы были скромнее, включая 500 млн долларов для **DGrid AI** и 400 млн долларов для **Quote Trade**. Параллельно продолжился сильный приток капитала в **AI и робототехнику**: * **Fireworks** (AI-облачные сервисы) привлекла 15 млрд долларов. * Венчур **Walden Robotics** (гуманоидные роботы) и китайская компания **Climber Dynamics** (также гуманоидные роботы) привлекли 3 млрд и почти 2 млрд долларов соответственно. Также на неделе были отмечены несколько значимых **приобретений**, включая покупку японским SBI Holdings сингапурской биржи Coinhako.

marsbit59 мин. назад

Еженедельный отчет о финансировании | Crypto.com привлекает 400 миллионов долларов, CeFi и стабильные монеты продолжают привлекать капитал

marsbit59 мин. назад

Самое мягкое медвежье дно? Медведи BTC уходят, а ARK и Bitwise единогласно смотрят вверх

20 июля 2026 года рынок криптовалют демонстрирует смешанные сигналы. BTC колеблется около $75 000, ETH откатился до $1900, а альткойны остаются вялыми. Индекс страха находится на уровне 35, указывая на преобладание паники. Тем не менее, появляются признаки потенциального дна. По данным Polymarket, существует 33% вероятность падения BTC ниже $50 000 к концу года. ARK Invest отмечает, что, несмотря на техническую слабость, наблюдается рост доли долгосрочных держателей и поставок в убытке — возможные сигналы истощения продавцов. Bitwise называет текущий спад «структурно самым мягким медвежьим рынком» для BTC, подчеркивая, что минимумы циклов последовательно повышаются благодаря институциональному принятию. Аналитики технического анализа предполагают, что важная зона поддержки сформировалась между $59 000 и $70 000. Точка зрения разнится: одни считают, что низ волны C, возможно, уже сформирован около $57 000, другие предупреждают, что неспособность преодолеть $66 000 повышает риск локального максимума. Значительный торговец Doctor Profit сообщил о закрытии всех коротких позиций и начале поэтапного накопления биткойнов в диапазоне $54 000–$64 000, ссылаясь на структурные улучшения, такие как прогресс в регулировании. Общий консенсус сводится к тому, что, несмотря на сохраняющиеся макроэкономические риски и волатильность, текущая коррекция может быть более умеренной, а институциональное накопление указывает на формирование долгосрочной основы для восстановления.

Foresight News1 ч. назад

Самое мягкое медвежье дно? Медведи BTC уходят, а ARK и Bitwise единогласно смотрят вверх

Foresight News1 ч. назад

Эволюция порядка в эпоху ИИ и Web3: Конкурентные аспекты m&W и пути исследования

Человечество переживает переход от «повышения производительности» к «трансформации производственных отношений». С развитием AI Agent (интеллектуальных агентов) высвобождается беспрецедентный кремниевый производственный потенциал. В будущем все больше задач будут выполнять не отдельные индивиды, а совместные сети людей, AI Agent и мультиагентные системы. Ключевой вопрос: как установить доверительные отношения между незнакомыми людьми и AI Agent для долгосрочного сотрудничества? Как оценивать сложный вклад? Как создать стабильные, справедливые и устойчивые механизмы распределения стоимости между разными субъектами? Web3 заложил основу для децентрализованной экономики, изучая идентичность, активы, организацию и инфраструктуру. Однако в эпоху AI Agent простого решения проблем владения активами и транзакций уже недостаточно. Будущим интеллектуальным сетям нужна новая система порядка, охватывающая идентичность, кредит, сотрудничество и экономические стимулы. m&WDAO, через свою концепцию EcoFi (Экологический Финансы / Экологический Порядок), исследует модель нового порядка для экономики совместной деятельности человека и машины. Она стремится соединить когнитивные активы человека, исполнительные способности AI Agent и экономические механизмы на блокчейне. Конкуренция m&W разворачивается в измерении построения инфраструктуры для будущих интеллектуальных сетей: как в них генерируется доверие, как происходит сотрудничество и как стоимость постоянно фиксируется. В статье анализируются существующие подходы, такие как Colony (коллаборация и управление в DAO), SingularityNET (обмен возможностями ИИ), Gitcoin Passport/Verax (инфраструктура идентичности и репутации), Farcaster и Lens Protocol (открытые социальные сети). Отмечается, что в то время как эти проекты решают важные частные задачи, m&W фокусируется на более фундаментальном вопросе построения доверия и механизмов сотрудничества между людьми и AI Agent. Эволюционный путь m&W представлен в три этапа: 1. **m&W 1.0: Кредитный якорь.** Создание сети высококачественных участников (Builders) через строгий отбор ("столкновение протонов") и превращение их вклада в невозвращаемые кредитные активы (SBT - Soulbound Token). 2. **m&W 2.0: Экономика сотрудничества.** Протокол EcoFi трансформирует кредитные активы в производительность, создавая замкнутую экономическую петлю для проверки, оценки и вознаграждения сложного, неструктурированного вклада с использованием гибридной системы проверки (ИИ + человек + арбитражная сеть). 3. **m&W 3.0: Интеллектуальный порядок.** Создание экономики AI Agent, где долгосрочные проверенные заслуги человека служат кредитной основой для его "цифрового двойника" (AI Agent), что позволяет агентам участвовать в экономической сети как доверенным субъектам. Проект сталкивается с вызовами, включая сложный "холодный старт" из-за высоких требований к участникам, необходимость баланса между автоматизацией ИИ и человеческим суждением, а также построение устойчивой токеномики ($CMW). В заключение, миссия m&W заключается не в создании еще одного рынка AI-услуг, а в исследовании новых производственных отношений для эпохи ИИ. Цель - соединить кредит, основанный на долгосрочном вкладе человека, способности к сотрудничеству AI Agent, механизмы блокчейна и экономические стимулы, чтобы заложить основу для надежного, справедливого и устойчивого порядка в будущих сетях совместной деятельности человека и машины.

链捕手1 ч. назад

Эволюция порядка в эпоху ИИ и Web3: Конкурентные аспекты m&W и пути исследования

链捕手1 ч. назад

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

Поздравляем команду Китая с завоеванием чемпионского титула на 67-й Международной математической олимпиаде (IMO 2026) в Шанхае! Китайская команда, все участники которой получили золотые медали, набрала 232 балла, опередив занявшую второе место команду США на 25 очков. Трое китайских школьников — Дэн Лэянь и Чжан Болунь из Шанхайской средней школы, а также Лю Чэ из Второй средней школы при Восточно-Китайском педагогическом университете — получили золотые медали с идеальным результатом в 42 балла. Это уже 26-я победа Китая в общем зачёте с 1989 года. Впервые IMO проводилась в средней школе — Шанхайской средней школе, чьи ученики в сумме завоевали уже 20 золотых медалей IMO. Особое внимание в этом году привлекло участие ИИ. Сообщается, что GPT-5.6 Pro впервые с первой попытки решил все шесть задач IMO 2026, продемонстрировав потенциал перехода от поиска методом проб и ошибок к точному и безошибочному решению, что ранее считалось исключительной чертой человеческого интеллекта.

marsbit1 ч. назад

Китай завоевывает все 42 балла на IMO 2026, Шанхайская средняя школа выметает золотые медали, GPT-5.6 повторяет момент AlphaGO

marsbit1 ч. назад

Торговля

Спот
活动图片