OpenAI решает 10 математических проблем, а Fable «воспроизводит» 5 из них за 24 часа

marsbitОпубликовано 2026-08-05Обновлено 2026-08-05

Введение

OpenAI и Anthropic вступили в прямое соревнование на переднем крае математики. 1 августа исследователь OpenAI Себастьен Бубек объявил, что их неанонсированная модель следующего поколения Astra доказала 10 передовых математических результатов, предоставив соответствующие сертификаты Lean и анализ решений. Эти проблемы, остававшиеся нерешёнными десятилетиями, являются серьёзным достижением; по мнению экспертов, одно только доказательство существования несофийской группы заслуживает публикации в ведущем журнале. Ответ Anthropic последовал менее чем через 24 часа. Исследователь Левант Альпёге заявил, что используя публично доступную модель Fable в автономном режиме и с общими промптами, он независимо воспроизвёл 5 из 10 результатов Astra (проблемы 4-8). Если это подтвердится, период исключительности открытия сократится до одних суток. OpenAI оценил затраты на поиск этих решений менее чем в 2000 долларов (маржинальные вычислительные расходы), что радикально снижает стоимость получения нового математического знания. Однако в эту сумму не входят расходы на обучение модели, подготовку 249-страничной статьи, формализацию доказательств и их проверку математиками. Этот эпизод выходит за рамки обычного «соревнования в рейтингах». Независимое воспроизведение одних и тех же неизвестных ранее результатов двумя разными ИИ напоминает процедуру рецензирования и ставит вопрос о надёжности таких доказательств. Ключевой проблемой становится их верификация: большинство людей не в состоянии оцен...

10 математических задач, 24 часа на разворот.

В эти выходные два гиганта искусственного интеллекта, OpenAI и Anthropic, сошлись в ближнем бою на переднем крае математики.

Сначала, 1 августа, исследователь OpenAI Себастьен Бубек объявил, что их неанонсированная следующая основная модель Astra доказала 10 передовых математических результатов, выложив 10 сертификатов Lean и 10 пошаговых разборов решений по каждой задаче.

Не стоит недооценивать эти 10 проблем.

Их основные выводы как минимум 10 лет не продвигались, многие застряли на десятилетия — это настоящие открытые проблемы.

Хотя это и не самые глубокие неразгаданные тайны математики, каждая из них — крепкий орешек.

Эллиот Глейзер, руководитель FrontierMath в Epoch AI, прямо заявил: только одна работа о несофийских группах наверняка попала бы в Annals of Mathematics, ведущий журнал, признанный математическим сообществом.

После появления этих 10 сложных задач сообщество ИИ взорвалось, кто-то сразу закричал: «Математическая сингулярность уже наступила».

Anthropic быстро ответили.

Менее чем за 24 часа исследователь Левент Алпёге ответил под постом Бубека: «Я выполнил половину с помощью Fable».

Затем он добавил, что решил задачи под номерами 4, 5, 6, 7 и 8 из списка OpenAI — всего 5.

Условия эксперимента, по словам Левента, были чистыми: полностью автономно, с универсальными промптами, без доступа к сети. Чтобы предотвратить утечку решений OpenAI в контекст, была добавлена дополнительная защита.

Конечно, Левент пока не опубликовал полные детали доказательств Fable, но пообещал, что загрузит их.

Однако, если это подтвердится, значимость события изменится:

Преимущество первенства, которое OpenAI получили с помощью невыпущенной модели Astra, продержалось всего 24 часа. А догнавшая их Fable — это модель от Anthropic, которая уже давно общедоступна и может быть использована каждым.

«Математическое первенство» со сроком годности всего в 24 часа

Пользователь Chubby репостнул: «Общедоступная Fable воспроизвела половину достижений Astra».

В комментариях пошутили: получается, OpenAI просто выиграли гонку за первое место?

Раньше споры о приоритете математического результата обычно измерялись годами.

Кто первый придумал, кто первый доказал, кто первый опубликовал — между этими событиями лежали долгие процессы подачи, рецензирования, доработки.

А теперь Astra еще официально не выпущена, но достижения, которые она объявила, всего за 24 часа уже наполовину догнаны общедоступной моделью.

Ценность первенства сохраняется, но срок его годности резко сократился.

Многие пользователи уже кричат о «математической сингулярности», а два гиганта ИИ плотно сцепились.

За 2000 долларов скрывается еще более дорогой счет

OpenAI также бросили еще одну цифру: на поиск этих 10 решений ушло менее 2000 долларов.

По словам исследователя Ноама Брауна, это соответствует токенам, необходимым для поиска этих решений, пересчитанным по ценам Sol API.

То есть это лишь предельные затраты на вычисления в момент успешного получения 10 решений.

Помимо этого, есть затраты на обучение и разработку самой Astra, на проблемы, которые пробовали, но не решили, на человеко-часы по оформлению доказательств в 249-страничную статью, на формализацию каждого доказательства в Lean, и, наконец, на внешнее рецензирование математиками.

Сам Ноам признает, что они пробовали решать и другие крупные проблемы, но безуспешно — ни одну из задач на премию тысячелетия взять не удалось.

Тем не менее, 2000 долларов все равно опустили предельную стоимость решения ИИ одной передовой математической задачи до минимального уровня.

Кто-то даже пошутил, не объявит ли OpenAI завтра еще 10 математических прорывов, или, может, на следующей неделе сразу 100.

От «гонки за рейтингами» к «взаимной проверке»

То, что Fable взялась за те же задачи, что и Astra, интереснее обычной гонки за рейтингами.

Гонка рейтингов измеряет известные ответы: задачи и эталонные решения уже есть, сравнивается, кто набрал больше баллов.

А когда две модели в условиях отсутствия сети и защиты от утечек независимо приходят к одному и тому же передовому выводу, проверяется совершенно другое: насколько надежен этот результат, можно ли его независимо воспроизвести.

Это больше похоже на рецензирование коллегами.

На данный момент Левент лишь «сделал заявление» в X, но не выложил PDF с этими 5 доказательствами, промпты, полные логи выполнения, стоимость в токенах или сертификаты Lean.

Пользователь Haider усомнился: даже если это правда, зачем использовать Fable для воспроизведения результатов Astra, вместо того чтобы сразу применять ее для решения новых открытых проблем?

На самом деле, Fable не просто пользуется популярностью Astra, она тоже решает новые задачи.

В июле Левент с помощью Fable привел трехмерный контрпример к гипотезе Якобиана, после чего кто-то даже специально написал 7-страничный материал по алгебраической проверке, подтвердив, что это явное отображение действительно опровергает гипотезу в размерности три и выше.

Достижения, которые большинство не понимает. Кто их примет?

Насколько важны эти 10 достижений, подавляющему большинству людей трудно судить.

Итан Моллик точно подметил: для почти каждого человека на Земле это не просто за пределами возможностей, а за пределами понимания. Мы можем лишь верить профессиональным математикам, которые скажут нам, впечатляет это или нет.

Код, изображения, чат — обычные люди еще могут на собственном опыте почувствовать, в чем сила ИИ.

Но существование несофийских групп, контрпример к гипотезе жесткости Конна, теорема о квантовом параллельном повторении — это понимает лишь горстка экспертов.

Чем дальше продвигаются возможности ИИ на научном фронте, тем больше публика вынуждена полагаться не на личный опыт, а на длинную цепочку доверия. Это состояние «даже удивляться нечему» происходит одновременно во все большем числе областей.

Математик Томас Блум напоминает, что эти результаты используют накопленную за сотни лет математическую теорию и формальные системы, созданные математиками вручную. Просто описывать это как «ИИ заменил математиков» — нечестно.

Его критерий таков: учит ли это доказательство нас чему-то новому об этой проблеме?

Так что настоящий вопрос в следующем: когда ИИ может с низкими затратами и серийно производить передовые математические доказательства, как нам оценивать его результаты?

Ответ, возможно, лежит не на стороне производства, а на стороне приемки: только то, можно ли доказательство прочитать, проверить и оценить его значимость, в конечном счете определяет его истинную ценность.

Самый дефицитный навык смещается с «создания доказательства» на «понимание и приемку доказательства».

Когда ИИ за одну ночь может доказать десять сложных задач, начинается настоящее испытание: доказательства создаются все быстрее, а успеем ли мы их проверить?

Источники:

https://x.com/haider1/status/2083908869915611554

https://x.com/polynoamial/status/2083470822258467194

https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742

Эта статья из WeChat Official Account «新智元» (New Zhiyuan), автор: ASI启示录

Связанные с этим вопросы

QКакую модель использовала OpenAI для решения 10 математических проблем, и что известно о её статусе?

AOpenAI использовала для этого свою следующую основную модель под названием Astra. На момент анонса результатов модель ещё не была публично выпущена.

QКакова была реакция и ответ компании Anthropic на достижения OpenAI?

AСотрудник Anthropic Левент Альпёге менее чем за 24 часа ответил в социальной сети X, что с помощью их публично доступной модели Fable независимо решил 5 из 10 проблем, представленных OpenAI (номера 4, 5, 6, 7, 8 в их списке).

QЧто означает стоимость в 2000 долларов, упомянутая OpenAI, и что она в себя включает?

A2000 долларов — это ориентировочная стоимость токенов, потраченных на поиск решений 10 проблем, рассчитанная по ценам API Sol. Это лишь предельные вычислительные расходы на момент получения успешных решений. В неё не входят затраты на обучение модели, неудачные попытки, работу по оформлению доказательств, их формализацию в Lean и проверку внешними математиками.

QПочему работа Fable над теми же проблемами, что и Astra, важнее обычного тестирования производительности?

AЭтот процесс больше похож на независимую проверку или рецензирование, чем на стандартный бенчмаркинг. Когда две разные модели в изолированных условиях (без доступа в интернет и с защитой от утечек) независимо приходят к одним и тем же новым научным выводам, это значительно повышает надёжность и достоверность этих результатов.

QКак в статье описывается основная проблема, возникающая, когда ИИ начинает генерировать сложные научные доказательства?

AОсновная проблема смещается с генерации доказательств на их проверку и оценку. Доказательства, создаваемые ИИ в таких узкоспециализированных областях, как передовая математика, могут понять и оценить лишь очень немногие эксперты. Поэтому самая дефицитная способность теперь — не «создать доказательство», а «понять, проверить и оценить его значение». Вопрос в том, сможет ли человеческая экспертиза поспевать за скоростью, с которой ИИ может производить такие результаты.

Похожее

Он был заслугой двух ведущих отраслей Шанхая, но ушел из жизни в тихом сожалении

Цзян Шанчжоу, бывший заместитель главы Шанхайского экономического комитета, сыграл ключевую роль в развитии двух стратегических отраслей города — полупроводниковой промышленности и производства коммерческих авиалайнеров. В конце 1990-х годов, когда китайская микроэлектронная отрасль находилась в застое, он смело предложил построить в Шанхае за пять лет десять 8-дюймовых линий по производству чипов, что значительно превышало общенациональные планы. Благодаря его усилиям по привлечению талантов, таких как Чжан Жуцзин, был основан SMIC, а также создана компания AMEC. Это заложило основу для того, чтобы Шанхай стал лидером в полупроводниковой отрасли Китая. Параллельно, будучи руководителем группы по论证нию крупных государственных проектов, Цзян Шанчжоу, уже будучи болен раком лёгких, настойчиво продвигал включение проекта по созданию крупного пассажирского самолёта в государственный план развития. Его видение привело к возрождению авиационной промышленности в Шанхае и в конечном итоге к созданию самолёта C919. Несмотря на свой стратегический ум и дальновидность, карьера Цзян Шанчжоу часто сталкивалась с непониманием из-за опережающих своё время идей, будь то в Санье, Янпу или Шанхае. Он скончался в 2011 году от рака, не дожив до полного расцвета отраслей, которые он помог создать. Однако его наследие живёт: Шанхай сегодня является ведущим центром Китая в области集成电路 и коммерческого авиастроения, во многом благодаря основам, заложенным Цзян Шанчжоу. Его жизнь — это пример преданности долгосрочному развитию страны.

marsbit5 мин. назад

Он был заслугой двух ведущих отраслей Шанхая, но ушел из жизни в тихом сожалении

marsbit5 мин. назад

Фокус доходов AMD: как за 12 кварталов акцент сместился в сторону дата-центров

В отчете AMD за второй квартал отмечается, что доход от бизнеса в области центров обработки данных достиг 6,718 млрд долларов США, увеличившись на 107% в годовом исчислении, в то время как доход от игрового бизнеса упал на 31% до 779 млн долларов. За 12 кварталов доля центра обработки данных в общем доходе компании выросла с 27,6% до 58,2%, став крупнейшим подразделением с четвертого квартала 2025 года. Хотя сокращение игрового бизнеса произошло в тот же период, данные не подтверждают прямого переноса ресурсов между этими направлениями. Общий доход компании вырос, что указывает на расширение всей бизнес-базы, а не просто на внутреннее перераспределение. По сравнению с конкурентами, темпы роста AMD в сегменте ЦОД высоки, но абсолютный объем дохода (6,718 млрд долларов) все еще значительно уступает NVIDIA (около 75,2 млрд долларов) и близок к показателю Intel DCAI (6,262 млрд долларов), хотя определения подразделений различаются. Таким образом, центры обработки данных стали главным источником дохода для AMD, но открытая отчетность не позволяет сделать вывод о прямой замене одного бизнеса другим.

marsbit5 мин. назад

Фокус доходов AMD: как за 12 кварталов акцент сместился в сторону дата-центров

marsbit5 мин. назад

Объясняем Cloudflare Wallet: новый игрок в стабильных платежах с использованием x402

4 августа Cloudflare анонсировала кошельки (Wallets), но на данный момент пользователи могут лишь зарезервировать уникальный идентификатор (handle). Функции пополнения, платежей и виртуальных кошельков для AI-агентов пока не реализованы, их релиз запланирован на будущее. Эту новость следует рассматривать в контексте других платежных инициатив Cloudflare: Stripe Projects (открытый бета-тест, позволяет агенту оплачивать услуги с лимитом), Monetization Gateway (для приема платежей через x402) и самих Wallets. Wallets предназначены для управления идентификацией, балансом и правилами авторизации плательщика, а не являются готовой платежной сетью. Данные протокола x402 (7.5 млн транзакций на $2.4 млн за 30 дней, ~$0.32 за транзакцию) демонстрируют его активность для микроплатежей, но не отражают уровень внедрения именно кошельков Cloudflare, так как x402 — это открытый стандарт. Пример Cloudflare с оплатой вызова API в $0.01 через MCP-сервер иллюстрирует идею микроплатежей, но текущая реализация для разработчиков требует от них хранения приватных ключей и использования тестовых сетей. Планируемые функции Wallets, такие как разделение кошельков для учетной записи и агентов, лимиты и белые списки, пока недоступны для настройки. Таким образом, анонс представляет собой скорее декларацию о намерениях и первый шаг — регистрацию идентификаторов. Ключевые вопросы — поддержка стейблкоинов и блокчейнов, KYC, тарифы и детали реализации — остаются без ответа. Основной акцент сделан на создании безопасной инфраструктуры для автоматических платежей AI-агентов в будущем.

marsbit26 мин. назад

Объясняем Cloudflare Wallet: новый игрок в стабильных платежах с использованием x402

marsbit26 мин. назад

TradeXYZ и Hyperliquid: раскрытие симбиотических отношений при разделе 50%

Рынок сохраняет осторожность: инвестиции в ИИ поощряются только при условии роста без ущерба для денежных потоков. В криптосфере давление оказывают отток средств из ETF и рост доходности гособлигаций. Внутри крипторынка лидерство перешло к Solana и DEX. Solana выросла на 8,5%, во многом благодаря токену META, а сектор DEX — на 5,2%, чему способствовал рост Uniswap. Ключевой темой стала дискуссия вокруг TradeXYZ и Hyperliquid. TradeXYZ, независимая команда, построившая на Hyperliquid рынок RWA-активов, который теперь составляет более 50% объема торгов Hyperliquid. По условиям HIP-3, TradeXYZ обязана направлять 50% своих доходов от комиссий Hyperliquid, оставляя половину себе. Возникают опасения, что высокий процент отчислений может подтолкнуть TradeXYZ к уходу с платформы. Однако анализ показывает симбиотические отношения: Hyperliquid предоставляет инфраструктуру, пользователей и обеспечение, а TradeXYZ — исполнение и инновации. Уход был бы равносилен репутационному и экономическому самоубийству для обеих сторон. Hyperliquid также монетизирует себя через приоритетные сборы за запись, плату за чтение от маркет-мейкеров и увеличение поставок стейблкоинов (например, USDC), что приносит значительный доход. Таким образом, главный вопрос — не в разделе доходов 50/50, а в том, как обе стороны перейдут от модели агрессивного роста к более стабильной и прибыльной основе с более высокими комиссиями.

marsbit41 мин. назад

TradeXYZ и Hyperliquid: раскрытие симбиотических отношений при разделе 50%

marsbit41 мин. назад

Отчет: DeepSeek возобновил привлечение финансирования, оценка перед инвестированием составила 500 миллиардов юаней

Несколько источников сообщают, что компания DeepSeek, разработчик больших языковых моделей, возобновила переговоры по второму раунду финансирования. Целевой сбор составляет 50 млрд юаней, а предварительная оценка компании перед инвестициями достигла примерно 500 млрд юаней. Планируется завершить сделки к концу августа. В июне этого года DeepSeek успешно закрыла первый раунд, привлекший 50 млрд юаней при оценке свыше 350 млрд юаней. Второй раунд был временно приостановлен в конце июля, но теперь переговоры возобновились, хотя и проходят более сдержанно. Ожидается, что в двух раундах компания привлечет более 100 млрд юаней. Конкуренция на рынке ИИ-моделей ужесточается. Компания Moonshot AI (月之暗面) в конце июля завершила раунд финансирования с оценкой около 210 млрд юаней и готовится к Pre-IPO раунду. Успех финансирования тесно связан с выходом новых моделей. DeepSeek недавно выпустила официальную тестовую версию DeepSeek-V4-Flash, которая демонстрирует высокую производительность при низкой стоимости, укрепив свою конкурентоспособность. Согласно данным платформы OpenRouter, эта модель в настоящее время лидирует по объему потребляемых токенов.

marsbit1 ч. назад

Отчет: DeepSeek возобновил привлечение финансирования, оценка перед инвестированием составила 500 миллиардов юаней

marsbit1 ч. назад

Торговля

Спот
活动图片