10 математических задач, 24 часа на разворот.
В эти выходные два гиганта искусственного интеллекта, OpenAI и Anthropic, сошлись в ближнем бою на переднем крае математики.
Сначала, 1 августа, исследователь OpenAI Себастьен Бубек объявил, что их неанонсированная следующая основная модель Astra доказала 10 передовых математических результатов, выложив 10 сертификатов Lean и 10 пошаговых разборов решений по каждой задаче.

Не стоит недооценивать эти 10 проблем.
Их основные выводы как минимум 10 лет не продвигались, многие застряли на десятилетия — это настоящие открытые проблемы.

Хотя это и не самые глубокие неразгаданные тайны математики, каждая из них — крепкий орешек.
Эллиот Глейзер, руководитель FrontierMath в Epoch AI, прямо заявил: только одна работа о несофийских группах наверняка попала бы в Annals of Mathematics, ведущий журнал, признанный математическим сообществом.
После появления этих 10 сложных задач сообщество ИИ взорвалось, кто-то сразу закричал: «Математическая сингулярность уже наступила».
Anthropic быстро ответили.
Менее чем за 24 часа исследователь Левент Алпёге ответил под постом Бубека: «Я выполнил половину с помощью Fable».

Затем он добавил, что решил задачи под номерами 4, 5, 6, 7 и 8 из списка OpenAI — всего 5.
Условия эксперимента, по словам Левента, были чистыми: полностью автономно, с универсальными промптами, без доступа к сети. Чтобы предотвратить утечку решений OpenAI в контекст, была добавлена дополнительная защита.

Конечно, Левент пока не опубликовал полные детали доказательств Fable, но пообещал, что загрузит их.
Однако, если это подтвердится, значимость события изменится:
Преимущество первенства, которое OpenAI получили с помощью невыпущенной модели Astra, продержалось всего 24 часа. А догнавшая их Fable — это модель от Anthropic, которая уже давно общедоступна и может быть использована каждым.
«Математическое первенство» со сроком годности всего в 24 часа
Пользователь Chubby репостнул: «Общедоступная Fable воспроизвела половину достижений Astra».

В комментариях пошутили: получается, OpenAI просто выиграли гонку за первое место?
Раньше споры о приоритете математического результата обычно измерялись годами.
Кто первый придумал, кто первый доказал, кто первый опубликовал — между этими событиями лежали долгие процессы подачи, рецензирования, доработки.
А теперь Astra еще официально не выпущена, но достижения, которые она объявила, всего за 24 часа уже наполовину догнаны общедоступной моделью.
Ценность первенства сохраняется, но срок его годности резко сократился.
Многие пользователи уже кричат о «математической сингулярности», а два гиганта ИИ плотно сцепились.
За 2000 долларов скрывается еще более дорогой счет
OpenAI также бросили еще одну цифру: на поиск этих 10 решений ушло менее 2000 долларов.
По словам исследователя Ноама Брауна, это соответствует токенам, необходимым для поиска этих решений, пересчитанным по ценам Sol API.

То есть это лишь предельные затраты на вычисления в момент успешного получения 10 решений.
Помимо этого, есть затраты на обучение и разработку самой Astra, на проблемы, которые пробовали, но не решили, на человеко-часы по оформлению доказательств в 249-страничную статью, на формализацию каждого доказательства в Lean, и, наконец, на внешнее рецензирование математиками.
Сам Ноам признает, что они пробовали решать и другие крупные проблемы, но безуспешно — ни одну из задач на премию тысячелетия взять не удалось.
Тем не менее, 2000 долларов все равно опустили предельную стоимость решения ИИ одной передовой математической задачи до минимального уровня.
Кто-то даже пошутил, не объявит ли OpenAI завтра еще 10 математических прорывов, или, может, на следующей неделе сразу 100.

От «гонки за рейтингами» к «взаимной проверке»
То, что Fable взялась за те же задачи, что и Astra, интереснее обычной гонки за рейтингами.
Гонка рейтингов измеряет известные ответы: задачи и эталонные решения уже есть, сравнивается, кто набрал больше баллов.
А когда две модели в условиях отсутствия сети и защиты от утечек независимо приходят к одному и тому же передовому выводу, проверяется совершенно другое: насколько надежен этот результат, можно ли его независимо воспроизвести.
Это больше похоже на рецензирование коллегами.
На данный момент Левент лишь «сделал заявление» в X, но не выложил PDF с этими 5 доказательствами, промпты, полные логи выполнения, стоимость в токенах или сертификаты Lean.
Пользователь Haider усомнился: даже если это правда, зачем использовать Fable для воспроизведения результатов Astra, вместо того чтобы сразу применять ее для решения новых открытых проблем?

На самом деле, Fable не просто пользуется популярностью Astra, она тоже решает новые задачи.
В июле Левент с помощью Fable привел трехмерный контрпример к гипотезе Якобиана, после чего кто-то даже специально написал 7-страничный материал по алгебраической проверке, подтвердив, что это явное отображение действительно опровергает гипотезу в размерности три и выше.
Достижения, которые большинство не понимает. Кто их примет?
Насколько важны эти 10 достижений, подавляющему большинству людей трудно судить.
Итан Моллик точно подметил: для почти каждого человека на Земле это не просто за пределами возможностей, а за пределами понимания. Мы можем лишь верить профессиональным математикам, которые скажут нам, впечатляет это или нет.

Код, изображения, чат — обычные люди еще могут на собственном опыте почувствовать, в чем сила ИИ.
Но существование несофийских групп, контрпример к гипотезе жесткости Конна, теорема о квантовом параллельном повторении — это понимает лишь горстка экспертов.
Чем дальше продвигаются возможности ИИ на научном фронте, тем больше публика вынуждена полагаться не на личный опыт, а на длинную цепочку доверия. Это состояние «даже удивляться нечему» происходит одновременно во все большем числе областей.
Математик Томас Блум напоминает, что эти результаты используют накопленную за сотни лет математическую теорию и формальные системы, созданные математиками вручную. Просто описывать это как «ИИ заменил математиков» — нечестно.
Его критерий таков: учит ли это доказательство нас чему-то новому об этой проблеме?
Так что настоящий вопрос в следующем: когда ИИ может с низкими затратами и серийно производить передовые математические доказательства, как нам оценивать его результаты?
Ответ, возможно, лежит не на стороне производства, а на стороне приемки: только то, можно ли доказательство прочитать, проверить и оценить его значимость, в конечном счете определяет его истинную ценность.
Самый дефицитный навык смещается с «создания доказательства» на «понимание и приемку доказательства».
Когда ИИ за одну ночь может доказать десять сложных задач, начинается настоящее испытание: доказательства создаются все быстрее, а успеем ли мы их проверить?
Источники:
https://x.com/haider1/status/2083908869915611554
https://x.com/polynoamial/status/2083470822258467194
https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742
Эта статья из WeChat Official Account «新智元» (New Zhiyuan), автор: ASI启示录





