Обычный человек задаёт ИИ сложную математическую задачу, постоянно говорит ему «продолжай», и сможет ли тот в итоге её решить, помогая выиграть крупную денежную премию или даже изменить ход развития математики?
Недавно была объявлена премия Филдса, и дискуссии о математике + ИИ стали очень оживлёнными. Наверняка многие представляли себе такой «захватывающий» сценарий, который я описал выше.
На самом деле, в реальности уже есть люди, которые пытаются это сделать, но процесс не так гладок, как можно себе представить.
Недавно ведущий эксперт по обратимым вычислениям и вычислительной физике Майкл П. Франк сообщил, что он поставил перед GPT-5.6 Sol сложную исследовательскую цель: изучить, существует ли для Великой теоремы Ферма более простой путь доказательства, чем доказательство Уайлса — Тейлора, с акцентом на модулярность специализированных кривых Фрея, методе бесконечного спуска, арифметических неравенствах типа abc и однородных факторах низкого рода; вести строгие записи, проверять кандидаты в леммы путём вычислений и чётко различать доказанные результаты и предположения.

Эта задача работала в фоновом режиме примерно 33 часа, потребляя значительные вычислительные ресурсы. Но в итоге она была принудительно остановлена системой OpenAI.
В своём последующем анализе GPT-5.6 Sol написала, что возможны две причины: во-первых, система определила, что сессия потребляет слишком много ресурсов; во-вторых, OpenAI ранее уже пробовала решить эту проблему с помощью аналогичной модели и потерпела неудачу, и на этот раз не хочет тратить вычислительные мощности впустую.

Похоже, Майкл П. Франк согласен с этим анализом GPT-5.6 Sol.

Кроме того, GPT-5.6 Sol также честно отчиталась о том, что делала в течение этих 33 часов. Суть в следующем: была проделана серьёзная работа, многие «звучащие многообещающе» короткие пути были превращены в проверяемые точные утверждения, которые затем были опровергнуты или исключены один за другим. Результатом стала карта «тупиковых путей», а не само доказательство. Рекомендовано остановиться.
Что касается такого подхода OpenAI, некоторые предлагают и другие возможные интерпретации: OpenAI, возможно, скрывает возможности, не позволяя модели легко решать сверхсложные математические задачи, опасаясь, что кто-то другой перехватит инициативу, или хочет присвоить себе славу. Это служит напоминанием: если в будущем слишком полагаться на них, это будет означать передачу всей власти над «тем, что может быть открыто» в руки одной компании, что весьма опасно.


Однако вскоре старший научный сотрудник OpenAI Ноам Браун выступил против, указав на необоснованность такого предположения. Он заявил: «Если бы кто-то просто ввёл команду continue (продолжить), использовал нашу модель для решения проблемы тысячелетия, а затем забрал приз в 1 миллион долларов, это была бы лучшая реклама для OpenAI, лучше и быть не может».

Это звучит логично, но оппоненты считают, что предоставление пользователям доступа к передовым возможностям действительно может принести краткосрочные рекламные выгоды, но в долгосрочной перспективе ослабит лидирующие позиции OpenAI в гонке ИИ. В условиях многопользовательской конкуренции сохранение в секрете / внутренний приоритетный доступ к мощным моделям для ускорения собственных исследований важнее, чем позволять пользователям «первыми» решать крупные проблемы. И как только возможности станут «доступными для всех», их рекламная ценность резко упадёт.
Кроме того, недавние события, связанные с регулированием, также дают OpenAI повод сохранять потенциал. Если пользователи публичной версии решат сложную математическую задачу, это публично докажет, что «эта модель на самом деле очень мощная», что, в свою очередь, может привлечь внимание регуляторов. В такой ситуации сознательное предоставление публике ослабленной версии модели при сохранении сверхмощной версии для внутреннего использования звучит как разумный шаг.

Тем не менее, некоторые с технической точки зрения указывают на другую возможность: в codex-cli «goal blocked» означает, что модель в течение трёх последовательных циклов рассуждений (turns) натыкается на одно и то же ограничение/блокировку. Таким образом, остановка задачи может быть обычным механизмом безопасности / предотвращения зависания во время выполнения модели, а не специальной блокировкой, направленной на сложные задачи.

Кто-то говорит, что это могло быть вызвано просто ошибкой (багом). А именно, у Sol версии 5.6 есть раздражающий баг при выполнении длительных задач. Временное решение: переключиться обратно на версию 5.5, сжать контекст, поработать несколько минут на версии 5.5, а затем снова переключиться на Sol версии 5.6. «Если вы хотите сохранить ту же сессию, вы застрянете и не сможете выйти».

Что вы думаете по этому поводу? Делитесь в комментариях своим опытом использования ИИ для решения сложных задач или когда он вас «зависал».
Ссылки:
https://x.com/lu_sichu/status/2081367506468360495
Эта статья взята из официального аккаунта WeChat «Машинный разум» (ID:almosthuman2014), автор: Чжан Цянь








