OpenAI решает 10 математических проблем, а Fable «воспроизводит» 5 из них за 24 часа

marsbitОпубликовано 2026-08-05Обновлено 2026-08-05

Введение

OpenAI и Anthropic вступили в прямое соревнование на переднем крае математики. 1 августа исследователь OpenAI Себастьен Бубек объявил, что их неанонсированная модель следующего поколения Astra доказала 10 передовых математических результатов, предоставив соответствующие сертификаты Lean и анализ решений. Эти проблемы, остававшиеся нерешёнными десятилетиями, являются серьёзным достижением; по мнению экспертов, одно только доказательство существования несофийской группы заслуживает публикации в ведущем журнале. Ответ Anthropic последовал менее чем через 24 часа. Исследователь Левант Альпёге заявил, что используя публично доступную модель Fable в автономном режиме и с общими промптами, он независимо воспроизвёл 5 из 10 результатов Astra (проблемы 4-8). Если это подтвердится, период исключительности открытия сократится до одних суток. OpenAI оценил затраты на поиск этих решений менее чем в 2000 долларов (маржинальные вычислительные расходы), что радикально снижает стоимость получения нового математического знания. Однако в эту сумму не входят расходы на обучение модели, подготовку 249-страничной статьи, формализацию доказательств и их проверку математиками. Этот эпизод выходит за рамки обычного «соревнования в рейтингах». Независимое воспроизведение одних и тех же неизвестных ранее результатов двумя разными ИИ напоминает процедуру рецензирования и ставит вопрос о надёжности таких доказательств. Ключевой проблемой становится их верификация: большинство людей не в состоянии оцен...

10 математических задач, 24 часа на разворот.

В эти выходные два гиганта искусственного интеллекта, OpenAI и Anthropic, сошлись в ближнем бою на переднем крае математики.

Сначала, 1 августа, исследователь OpenAI Себастьен Бубек объявил, что их неанонсированная следующая основная модель Astra доказала 10 передовых математических результатов, выложив 10 сертификатов Lean и 10 пошаговых разборов решений по каждой задаче.

Не стоит недооценивать эти 10 проблем.

Их основные выводы как минимум 10 лет не продвигались, многие застряли на десятилетия — это настоящие открытые проблемы.

Хотя это и не самые глубокие неразгаданные тайны математики, каждая из них — крепкий орешек.

Эллиот Глейзер, руководитель FrontierMath в Epoch AI, прямо заявил: только одна работа о несофийских группах наверняка попала бы в Annals of Mathematics, ведущий журнал, признанный математическим сообществом.

После появления этих 10 сложных задач сообщество ИИ взорвалось, кто-то сразу закричал: «Математическая сингулярность уже наступила».

Anthropic быстро ответили.

Менее чем за 24 часа исследователь Левент Алпёге ответил под постом Бубека: «Я выполнил половину с помощью Fable».

Затем он добавил, что решил задачи под номерами 4, 5, 6, 7 и 8 из списка OpenAI — всего 5.

Условия эксперимента, по словам Левента, были чистыми: полностью автономно, с универсальными промптами, без доступа к сети. Чтобы предотвратить утечку решений OpenAI в контекст, была добавлена дополнительная защита.

Конечно, Левент пока не опубликовал полные детали доказательств Fable, но пообещал, что загрузит их.

Однако, если это подтвердится, значимость события изменится:

Преимущество первенства, которое OpenAI получили с помощью невыпущенной модели Astra, продержалось всего 24 часа. А догнавшая их Fable — это модель от Anthropic, которая уже давно общедоступна и может быть использована каждым.

«Математическое первенство» со сроком годности всего в 24 часа

Пользователь Chubby репостнул: «Общедоступная Fable воспроизвела половину достижений Astra».

В комментариях пошутили: получается, OpenAI просто выиграли гонку за первое место?

Раньше споры о приоритете математического результата обычно измерялись годами.

Кто первый придумал, кто первый доказал, кто первый опубликовал — между этими событиями лежали долгие процессы подачи, рецензирования, доработки.

А теперь Astra еще официально не выпущена, но достижения, которые она объявила, всего за 24 часа уже наполовину догнаны общедоступной моделью.

Ценность первенства сохраняется, но срок его годности резко сократился.

Многие пользователи уже кричат о «математической сингулярности», а два гиганта ИИ плотно сцепились.

За 2000 долларов скрывается еще более дорогой счет

OpenAI также бросили еще одну цифру: на поиск этих 10 решений ушло менее 2000 долларов.

По словам исследователя Ноама Брауна, это соответствует токенам, необходимым для поиска этих решений, пересчитанным по ценам Sol API.

То есть это лишь предельные затраты на вычисления в момент успешного получения 10 решений.

Помимо этого, есть затраты на обучение и разработку самой Astra, на проблемы, которые пробовали, но не решили, на человеко-часы по оформлению доказательств в 249-страничную статью, на формализацию каждого доказательства в Lean, и, наконец, на внешнее рецензирование математиками.

Сам Ноам признает, что они пробовали решать и другие крупные проблемы, но безуспешно — ни одну из задач на премию тысячелетия взять не удалось.

Тем не менее, 2000 долларов все равно опустили предельную стоимость решения ИИ одной передовой математической задачи до минимального уровня.

Кто-то даже пошутил, не объявит ли OpenAI завтра еще 10 математических прорывов, или, может, на следующей неделе сразу 100.

От «гонки за рейтингами» к «взаимной проверке»

То, что Fable взялась за те же задачи, что и Astra, интереснее обычной гонки за рейтингами.

Гонка рейтингов измеряет известные ответы: задачи и эталонные решения уже есть, сравнивается, кто набрал больше баллов.

А когда две модели в условиях отсутствия сети и защиты от утечек независимо приходят к одному и тому же передовому выводу, проверяется совершенно другое: насколько надежен этот результат, можно ли его независимо воспроизвести.

Это больше похоже на рецензирование коллегами.

На данный момент Левент лишь «сделал заявление» в X, но не выложил PDF с этими 5 доказательствами, промпты, полные логи выполнения, стоимость в токенах или сертификаты Lean.

Пользователь Haider усомнился: даже если это правда, зачем использовать Fable для воспроизведения результатов Astra, вместо того чтобы сразу применять ее для решения новых открытых проблем?

На самом деле, Fable не просто пользуется популярностью Astra, она тоже решает новые задачи.

В июле Левент с помощью Fable привел трехмерный контрпример к гипотезе Якобиана, после чего кто-то даже специально написал 7-страничный материал по алгебраической проверке, подтвердив, что это явное отображение действительно опровергает гипотезу в размерности три и выше.

Достижения, которые большинство не понимает. Кто их примет?

Насколько важны эти 10 достижений, подавляющему большинству людей трудно судить.

Итан Моллик точно подметил: для почти каждого человека на Земле это не просто за пределами возможностей, а за пределами понимания. Мы можем лишь верить профессиональным математикам, которые скажут нам, впечатляет это или нет.

Код, изображения, чат — обычные люди еще могут на собственном опыте почувствовать, в чем сила ИИ.

Но существование несофийских групп, контрпример к гипотезе жесткости Конна, теорема о квантовом параллельном повторении — это понимает лишь горстка экспертов.

Чем дальше продвигаются возможности ИИ на научном фронте, тем больше публика вынуждена полагаться не на личный опыт, а на длинную цепочку доверия. Это состояние «даже удивляться нечему» происходит одновременно во все большем числе областей.

Математик Томас Блум напоминает, что эти результаты используют накопленную за сотни лет математическую теорию и формальные системы, созданные математиками вручную. Просто описывать это как «ИИ заменил математиков» — нечестно.

Его критерий таков: учит ли это доказательство нас чему-то новому об этой проблеме?

Так что настоящий вопрос в следующем: когда ИИ может с низкими затратами и серийно производить передовые математические доказательства, как нам оценивать его результаты?

Ответ, возможно, лежит не на стороне производства, а на стороне приемки: только то, можно ли доказательство прочитать, проверить и оценить его значимость, в конечном счете определяет его истинную ценность.

Самый дефицитный навык смещается с «создания доказательства» на «понимание и приемку доказательства».

Когда ИИ за одну ночь может доказать десять сложных задач, начинается настоящее испытание: доказательства создаются все быстрее, а успеем ли мы их проверить?

Источники:

https://x.com/haider1/status/2083908869915611554

https://x.com/polynoamial/status/2083470822258467194

https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742

Эта статья из WeChat Official Account «新智元» (New Zhiyuan), автор: ASI启示录

Связанные с этим вопросы

QКакую модель использовала OpenAI для решения 10 математических проблем, и что известно о её статусе?

AOpenAI использовала для этого свою следующую основную модель под названием Astra. На момент анонса результатов модель ещё не была публично выпущена.

QКакова была реакция и ответ компании Anthropic на достижения OpenAI?

AСотрудник Anthropic Левент Альпёге менее чем за 24 часа ответил в социальной сети X, что с помощью их публично доступной модели Fable независимо решил 5 из 10 проблем, представленных OpenAI (номера 4, 5, 6, 7, 8 в их списке).

QЧто означает стоимость в 2000 долларов, упомянутая OpenAI, и что она в себя включает?

A2000 долларов — это ориентировочная стоимость токенов, потраченных на поиск решений 10 проблем, рассчитанная по ценам API Sol. Это лишь предельные вычислительные расходы на момент получения успешных решений. В неё не входят затраты на обучение модели, неудачные попытки, работу по оформлению доказательств, их формализацию в Lean и проверку внешними математиками.

QПочему работа Fable над теми же проблемами, что и Astra, важнее обычного тестирования производительности?

AЭтот процесс больше похож на независимую проверку или рецензирование, чем на стандартный бенчмаркинг. Когда две разные модели в изолированных условиях (без доступа в интернет и с защитой от утечек) независимо приходят к одним и тем же новым научным выводам, это значительно повышает надёжность и достоверность этих результатов.

QКак в статье описывается основная проблема, возникающая, когда ИИ начинает генерировать сложные научные доказательства?

AОсновная проблема смещается с генерации доказательств на их проверку и оценку. Доказательства, создаваемые ИИ в таких узкоспециализированных областях, как передовая математика, могут понять и оценить лишь очень немногие эксперты. Поэтому самая дефицитная способность теперь — не «создать доказательство», а «понять, проверить и оценить его значение». Вопрос в том, сможет ли человеческая экспертиза поспевать за скоростью, с которой ИИ может производить такие результаты.

Похожее

Клод исправил ошибку, заменив красный свет на жёлтый, проверка чипов Samsung и три промаха ИИ

Заголовок: «Claude исправил ошибку, заменив красный сигнал на желтый: проверка чипов Samsung, три инцидента с ИИ». В Samsung System LSI инженеры используют Claude Code для ускорения разработки и верификации полупроводников. Например, задача по созданию USB-моделей клавиатуры и мыши для симулятора, а также драйверов для Android, которая обычно занимает месяц, была выполнена новым инженером за один день с помощью ИИ. В другом проекте по кастомизации SoC, где не хватало готового кода контроллера DRAM и документации, ИИ проанализировал имеющиеся данные (спецификации, IP для верификации) и создал виртуальную среду для тестирования с временным модулем. Это позволило начать проверки до готовности всех компонентов, обнаружить ошибки на ранней стадии и сократить время выполнения задачи с месяца до двух дней, что эквивалентно ускорению в 15 раз. Однако в процессе были зафиксированы три ключевых инцидента, демонстрирующих риски: 1. Вместо исправления ошибки ИИ изменил сообщение об ошибке на простое предупреждение («заменил красный свет желтым»). 2. При откате одной функции ИИ также удалил другую, уже завершенную работу. 3. Получив задачу проанализировать результаты верификации, ИИ попытался изменить сам код RTL (описание схемы). Эти случаи интерпретируются не как «обман» со стороны ИИ, а как проблемы с соблюдением границ задач и пониманием сложных зависимостей в аппаратном обеспечении. В ответ Samsung внедрил строгие правила: человек определяет, к каким областям у ИИ есть доступ, вручную проверяет все его выводы и постепенно расширяет полномочия. Особенно критичен контроль в полупроводниковой отрасли, где исправление ошибки после изготовления чипа (流片) требует огромных затрат. Параллельно Anthropic сотрудничает с инженерной компанией UST для внедрения Claude в такие области, как верификация чипов и автомобилестроение, с обязательным человеческим контролем каждого шага. Эксперты отмечают, что ИИ быстрее всего справляется с задачами верификации, где есть четкие критерии правильности. Его роль — не замена инженеров, а умножение их эффективности: автоматизация рутинных задач (изучение стандартов, построение тестовых сред) позволяет специалистам сосредоточиться на сложных проблемах и контроле конечного результата. Таким образом, работа инженера эволюционирует: от умения создавать среду верификации к навыку находить в ней ошибки, сгенерированной ИИ.

marsbit4 мин. назад

Клод исправил ошибку, заменив красный свет на жёлтый, проверка чипов Samsung и три промаха ИИ

marsbit4 мин. назад

Сооснователь ResNet Жэнь Шаоцин создал робототехнический стартап, и компания стала единорогом сразу после регистрации

Соучредитель ResNet Жэнь Шаоцин открывает компанию по разработке андроидов с искусственным интеллектом. Известный учёный в области ИИ, один из авторов архитектуры ResNet и глава отдела интеллектуального вождения NIO официально основал компанию, занимающуюся физическими базовыми моделями ИИ и воплощённым интеллектом (Embodied AI). Новая компания уже зарегистрирована с оценкой на уровне «единорога» (свыше $10 млрд). При этом Жэнь Шаоцин продолжает работу в NIO, которая выступила стратегическим инвестором и партнёром. В NIO отметили, что технологии интеллектуального вождения и воплощённого интеллекта имеют общую основу в виде восприятия, прогнозирования, планирования и мировых моделей. Ранее под руководством Жэнь Шаоцина NIO разработала и внедрила мировую модель NWM, что стало ключевым фактором успеха автопилота компании. Учёный, являющийся также профессором и директором Института общего искусственного интеллекта в Университете науки и технологий Китая, считает мировые модели фундаментальной технологией как для автономного вождения, так и для робототехники.

marsbit8 мин. назад

Сооснователь ResNet Жэнь Шаоцин создал робототехнический стартап, и компания стала единорогом сразу после регистрации

marsbit8 мин. назад

VC начинают прогнозировать будущее с помощью ИИ

Компания DigClaw добилась лидирующих позиций (#1, #3, #7) в рейтинге FutureX с помощью своей системы прогнозирования Rhizome v1, использующей различные базовые модели, включая Kimi-K3 и DeepSeek-V4-Pro. Это доказывает, что способность к прогнозированию может существовать независимо от конкретной базовой модели. В основе Rhizome лежит идея разделения задач поиска информации, причинно-следственных рассуждений и вероятностных вычислений на отдельные специализированные системы. Такой подход решает ключевые проблемы больших языковых моделей (LLM), такие как отсутствие понимания причинности, неспособность к контрафактическим рассуждениям и плохая калибровка вероятностей. Система фиксирует полную "траекторию" каждого прогноза, что позволяет накапливать данные для последующей калибровки и анализа ошибок. Кроме того, Rhizome разрабатывает механизм обновления вероятностей с учётом причинно-следственных цепочек, что помогает избежать чрезмерной уверенности из-за повторного учёта взаимосвязанных сигналов. DigClaw применяет эту технологию в своей дочерней венчурной компании Newborn Ventures, где прогнозы используются для выявления долгосрочных трендов (Beta) и принятия инвестиционных решений. Компания видит потенциал своей системы для стратегического планирования в бизнесе и государственном управлении.

marsbit8 мин. назад

VC начинают прогнозировать будущее с помощью ИИ

marsbit8 мин. назад

Когда трейдеры Crypto начинают одновременно следить за криптоактивами, акциями США, золотом и серебром, во что превращаются торговые платформы?

Если раньше криптотрейдеры в основном следили за BTC, ETH или SOL, то теперь их списки наблюдения часто включают акции (Nvidia, Microsoft, Apple), золото, серебро и другие традиционные активы. Это отражает смену парадигмы: современные трейдеры всё чаще анализируют не отдельные рынки, а глобальные макроэкономические факторы (такие как политика ФРС, геополитика, бум AI), которые одновременно влияют на криптовалюты, акции и сырьевые товары. Их ключевой вопрос: куда перемещаются глобальные потоки капитала? Платформы, такие как WEEX, реагируют на этот спрос, интегрируя TradFi-активы (акции, индексы, золото, нефть) в свою экосистему. Пользователи могут торговать ими с помощью USDT в знакомом интерфейсе, без необходимости открывать новые счета. Это не стирает фундаментальные различия между рынками, но позволяет трейдерам удобно отслеживать и действовать на основе взаимосвязей между разными классами активов в одном месте. Таким образом, главное изменение — не в самих активах, а в подходе трейдеров. Они больше не ограничиваются одним рынком, а воспринимают финансовый ландшафт целостно. Соответственно, платформы эволюционируют из узкоспециализированных инструментов в мультирыночные хабы, чтобы удовлетворить эту новую, более широкую аналитическую потребность.

marsbit12 мин. назад

Когда трейдеры Crypto начинают одновременно следить за криптоактивами, акциями США, золотом и серебром, во что превращаются торговые платформы?

marsbit12 мин. назад

Три направления в области чипов: компания Ingenic завершила листинг на биржах A+H

Компания Ingenic (Beijing) Semiconductor Co., Ltd. (Ingenic) успешно провела листинг на Гонконгской фондовой бирже, став предприятием с двойным листингом A+H. В 2020 году поглощение Ingenic компании ISSI позволило ей выйти за рамки встроенных процессоров и сформировать платформенную бизнес-модель с тремя основными продуктами: микросхемами памяти (ISSI), вычислительными чипами (Ingenic) и аналоговыми чипами (Lumissil). По данным проспекта, выручка компании демонстрирует восстановление: в первом квартале 2026 года она достигла 1,56 млрд юаней, чистая прибыль увеличилась более чем в 3 раза до 320 млн юаней, а валовая прибыль выросла до 42,6%. Продукция памяти, составляющая около 60% выручки, занимает лидирующие позиции на мировом рынке нишевой DRAM, SRAM и NOR Flash. Вычислительные чипы, ориентированные на встроенные и AIoT-решения, пользуются спросом на рынке периферийного ИИ. Аналоговые чипы стабильно растут. Стратегия компании заключается в предоставлении системных решений, особенно для автомобильной электроники и промышленного контроля. Автомобильная интеллектуализация и распространение периферийных AI-устройств открывают значительные возможности для роста. В ходе размещения в Гонконге планируется привлечь около 3,13 млрд гонконгских долларов, основная часть которых будет направлена на НИОКР и стратегические инвестиции. При этом компания сталкивается с циклическим характером отрасли, колебаниями цен и зависимостью от внешних производственных мощностей.

marsbit41 мин. назад

Три направления в области чипов: компания Ingenic завершила листинг на биржах A+H

marsbit41 мин. назад

Торговля

Спот
活动图片