Алгоритм, на котором обучают весь ИИ, приговорил сам себя к «смерти»?
Недавно исследователи из Университета Цинхуа и Уортонской школы бизнеса (Пенсильванский университет) опубликовали новую работу, которая даёт ответ, которого теория оптимизации ждала 40 лет —
чтобы градиентный спуск достиг максимальной скорости, недостаточно просто настраивать длину шага.


Это первый в истории случай, когда доказано, что для градиентного спуска, полагающегося исключительно на настройку длины шага, существует непреодолимый математический потолок.
И ключевое доказательство выполнил не человек, а GPT-5.6 Sol Pro.
GPT-5.6 справился с задачей, на которую 40 лет не было ответа
Вот как всё было.
Градиентный спуск всем знаком — под капотом GPT, Stable Diffusion и беспилотных автомобилей работает именно он. Стандартная скорость сходимости градиентного спуска составляет O(1/T): после T шагов ошибка уменьшается примерно до уровня 1/T.
В 1983 году Нестеров добавил к градиентному спуску инерцию (момент), что сразу подняло скорость до O(1/T²). При тех же 1000 шагах ошибка сокращается с одной тысячной до одной миллионной — разница в три порядка. Это до сих пор теоретический оптимум.
Естественно возникает вопрос: можно ли, не добавляя инерцию и не меняя структуру алгоритма, а только тщательно подбирая размер шага на каждом этапе, догнать метод Нестерова?
Эта проблема оставалась нерешённой целых 40 лет. До 2023 года, когда Алтшулер и Паррило из MIT представили «серебряный шаг» (silver stepsize).
Эта последовательность длин шагов не постепенно уменьшается, а колеблется, образуя фрактальную самоподобную структуру. С её помощью градиентный спуск достиг скорости O(T^{-1.2716}).

Так что же такое 1.2716 — окончательный предел для чистой настройки шага или только начало?
Недавно за эту задачу взялись наставник и ученик китайского происхождения.
Цзяньхао Ма (Jianhao Ma) только в июле начал работать на факультете промышленного инжиниринга Университета Цинхуа. Он получил докторскую степень в Мичиганском университете и после постдока в Пенсильванском университете вернулся в Китай на преподавательскую должность.
Его научный руководитель в постдоке, Юйсинь Чэнь (Yuxin Chen), — именной профессор Уортонской школы бизнеса, доктор наук Стэнфорда, перешедший из Принстона в Пенсильванский университет, лауреат премии SIAM за лучшую статью.


До этого все занимались сложением — придумывали более умные последовательности шагов, чтобы повысить скорость.
Ма и Чэнь же пошли от обратного, решив доказать существование линии, которую невозможно пересечь, как бы ни настраивать шаг.
Чтобы найти хорошую последовательность шагов, нужен всего один успешный пример. Но чтобы доказать, что «все возможные последовательности шагов не подходят», нужно сказать «нет» бесконечному множеству возможностей.
Подумав над этим, они просто дали задачу GPT-5.6 Sol Pro, чтобы ИИ попробовал.

Конкретно они дали GPT две вещи.
Первое — цель исследования: доказать, что чистая настройка шага не может достичь O(1/T²). Второе — высокоуровневую стратегию под названием «противостоящий оракул» (resisting oracle).
Её принцип заключается в том, чтобы сначала построить «враждебную» траекторию, на которой градиентный спуск движется максимально медленно, а затем найти реальную гладкую выпуклую функцию, путь градиентного спуска на которой точно совпадает с этой медленной дорогой.
После определения направления GPT-5.6 Sol Pro приступил к работе.

Итоговое ключевое решение, предложенное им, — геометрическая конструкция.
Для любой заданной последовательности неотрицательных длин шагов сначала выбираются «длинные шаги» — те, чья длина превышает стандартное безопасное значение 1/L. Затем в многомерном пространстве размещается набор взаимно перпендикулярных «якорей», каждый из которых соответствует одному длинному шагу.
Градиентный спуск вынужден двигаться в одном и том же направлении между двумя длинными шагами, а при встрече с длинным шагом перескакивает на следующее, полностью перпендикулярное направление. Вся эта траектория точно реализуется гладкой выпуклой функцией, называемой огибающей Море (Moreau envelope), и строго ей эквивалентна.
Ключевой момент этой конструкции в том, что она создаётся специально под вашу последовательность шагов. Как бы вы ни проектировали шаги, она может построить соответствующую функцию, которая вас остановит.
Но на этом доказательство не заканчивается.
Окончательная нижняя граница не должна зависеть от порядка появления длинных шагов, иначе та же последовательность, но в другом порядке, может позволить её обойти.
GPT-5.6 нашёл технику сопоставления: отсортировал длинные шаги по величине, построил путь, разбил их на чётные и нечётные группы для сопоставления, полностью устранив зависимость от последовательности. Затем он ввёл функцию Ляпунова для управления глобальным ростом и, используя метод усечения, собрал локальные ограничения в единую нижнюю границу.

Эта цепочка рассуждений была полностью сформирована в результате многократных итераций взаимодействия Ма и Чэня с GPT-5.6 Sol Pro: когда в рассуждениях обнаруживался изъян, они указывали на него, GPT исправлял и продолжал.
По словам самого Ма, в ключевом доказательстве нет ни одного нетривиального математического элемента, привнесённого человеком.
В доказательстве есть ключевой параметр, на который одновременно накладываются два ограничения: граница сопоставления даёт нижний предел, а контроль роста — верхний.
По мере снижения показателя сходимости p оба ограничения сжимаются. В точке p = √(2+√3) ≈ 1.9319 линии сходятся, и пространство для манёвра параметра исчезает. Двигаться дальше вниз доказательство не позволяет.
Окончательный вывод GPT-5.6 Sol Pro таков: для любой предопределённой последовательности неотрицательных длин шагов нижняя граница скорости сходимости градиентного спуска составляет Ω(T^{-1.9319}).

Градиентный спуск с чистой настройкой шага, как бы искусно ни была спроектирована последовательность шагов, никогда не преодолеет эту линию.
Другими словами, чтобы достичь максимальной скорости сходимости, необходимо менять структуру алгоритма.
Финальная проверка в Lean 4: ноль sorry, ноль admit
Как убедиться, что доказательство, написанное ИИ, — не галлюцинация?
Ма и Чэнь использовали самый строгий метод проверки в математике — систему автоматического доказательства теорем Lean 4.
С помощью Codex они поэтапно перевели естественноязыковое доказательство от GPT-5.6 Sol Pro в код на Lean 4.
Эта система формальной верификации построчно проверяет каждый шаг вывода. Любой логический скачок или недостающее обоснование приводят к немедленной ошибке компиляции.
Если какой-то шаг действительно невозможно доказать, можно вставить «sorry» или «admit», чтобы временно пропустить его — что означает «этот шаг я ещё не доказал».
Итоговый результат: ноль sorry, ноль admit. Ни один шаг не был пропущен.
Код опубликован на GitHub вместе с файлом TRACEABILITY.md, где каждая теорема из статьи построчно сопоставляется с соответствующим доказательством в коде на Lean. Любой желающий может скомпилировать и проверить сам.
Адрес проекта: https://github.com/jianhaoma/gd-lower-bound-lean
Вся цепочка верификации — это эстафета из трёх этапов. GPT-5.6 Sol Pro строит доказательство, Codex переводит его в Lean 4, компилятор построчно проводит финальную проверку. Люди на протяжении всего процесса осуществляют надзор.
Вам не нужно «верить» ИИ — пусть судит формальная система.
История ещё не закончена
На данный момент подтверждённый диапазон таков: «серебряный шаг» уже довёл градиентный спуск до T^{-1.2716}, а Ма и Чэнь доказали, что невозможно превысить T^{-1.9319}.
Между ними остаётся разрыв в 0.66. Где же находится истинный предел?
Исследователь в области оптимизации Бен Гриммер (Ben Grimmer), долгое время изучавший эту проблему, ознакомившись со статьей, заявил, что он «убеждён», что 1.2716 и есть истинный потолок.
Если он прав, то «серебряный шаг» уже является пределом для чистой настройки шага, и нижняя граница Ма и Чэня имеет потенциал для дальнейшего уточнения.
Но где бы ни находился истинный предел, эта статья уже выполнила самую важную часть работы: чистой настройкой шага невозможно достичь максимальной скорости градиентного спуска. Это превратилось из предположения в теорему.
И этот результат достигнут всего двумя людьми. Без команды математиков, без экспертов по Lean, без специального бюджетного фонда на вычисления, с использованием коммерческой версии GPT-5.6 Sol Pro, доступной каждому.
Если эту модель можно будет воспроизвести, любой исследователь в мире с хорошей задачей сможет поручить ИИ провести доказательство за него.
Ссылки на источники:
https://arxiv.org/abs/2608.10418
Эта статья взята из WeChat официального аккаунта «Синь Чжи Юань» (Новая Эра ИИ), автор: ASI启示录, редактор: Моисей





