На этот раз Claude действительно выбил разрыв в рейтинге AI-программирования!
Только что обновленный рейтинг MirrorCode: Claude Fable 5 с абсолютным успехом в 64% снова на вершине.
Следующий за ним GPT-5.6 Sol имеет лишь треть его баллов!
GPT-5.5 на четвертом месте еще хуже. Его результат — всего 10%, и он даже проигрывает своему предшественнику GPT-5.4.

Что еще более удивительно: при использовании таких языков, как Go, с большими ресурсами, процент решений Fable 5 составляет 64%; а при переходе на менее популярный язык Ada результат все еще достигает 61%.
Нужно знать, что в мире open source Python-кода примерно в 230 раз больше, чем Ada.
Но у Fable 5 результат упал всего на 3 процентных пункта.

Это интересно.
Если модель в основном полагается на запоминание синтаксиса и распространенных шаблонов популярных языков, то при переходе на Ada результаты должны были бы ухудшиться.
А текущий результат указывает на другую возможность:
Сильнейшие модели уже освободились от влияния конкретных корпусов данных и начали учиться создавать полноценные программные проекты с нуля.
Застряли на 100% проходимости, предельный тест на 100 миллиардов токенов
Конкретно, полный MirrorCode включает 25 целевых программ, охватывающих Unix-инструменты, интерпретаторы, запросы данных, биоинформатику, криптографию и инструменты сжатия.
Здесь модель помещается в изолированную среду без интернета, без доступа к исходному коду проекта и без возможности скачивания сторонних зависимостей. У нее есть только высокоуровневая документация, часть видимых тестов и оригинальная программа, которую можно вызывать многократно.
Затем она должна постоянно вводить данные в оригинальную программу, наблюдать за выводом, угадывать внутреннюю логику и постепенно писать новую программу с идентичным поведением.
Самый свежий рейтинг выбирает 15 Medium и Large целей. Для каждой цели используются два языка реализации, каждый язык запускается три раза.
И проходимость как видимых, так и скрытых тестов должна достигать 100%, чтобы считаться успешной, 99.9% недостаточно.
Если упущен хотя бы один пограничный случай, весь запуск все равно считается провалом.

Чтобы заставить модель заполнить оставшиеся пробелы, MirrorCode поднял бюджет на один запуск до 100 миллиардов токенов, с максимальным временем непрерывной работы в 7 дней.
В статье упоминается еще более экстремальная задача: модель работала непрерывно 19 дней, затраты на один запуск достигли 2600 долларов.
В течение этих 19 дней модель многократно запускала оригинальную программу, сравнивала результаты, дописывала функционал и снова запускала тесты. При ошибке она искала причину, при несовпадении вывода меняла гипотезу, и после локального успеха переходила к следующему пробелу.
Весь процесс больше похож на отладку, продолжающуюся несколько дней, а не на однократную генерацию.

Пример gotree наиболее нагляден.
Этот инструмент биоинформатики изначально содержал около 16 тысяч строк кода на Go и более 40 команд.
Claude Opus 4.7 потратил 14 часов и 251 доллар, прошел 2000 из 2001 теста, достигнув 99.95% завершенности.
Хотя он пропустил один редкий пограничный случай с обработкой даты в комментариях и был остановлен планкой 100% проходимости MirrorCode, он сжал объем работы, рассчитанный на недели, до нескольких часов:
По оценкам Epoch, если бы не использовался ИИ, инженеру-человеку потребовалось бы от 2 до 17 недель для выполнения той же задачи.
В пустыне корпусов данных Fable 5 потерял всего 3 балла
В статье о MirrorCode использовалась публичная обучающая смесь StarCoder в качестве референса.
В ней Python составляет около 8%, а Ada — всего 0.034%, первый примерно в 230 раз больше второго.

Конечно, мы не можем знать, сколько кода на Ada действительно видели закрытые модели. Но, взяв за референс открытую экосистему, редкость Ada становится достаточно очевидной.
Этот язык в основном используется в аэрокосмической отрасли, оборонном комплексе и других системах с высокими требованиями к безопасности. Сообщество, количество учебных материалов и open source проектов несопоставимо меньше, чем у Python, JavaScript или Go.
И Fable 5 явно не занимается построчным переводом кода с Go на Ada.
Он скорее сначала понимает, как работает оригинальная программа, а затем, на другом языке, воссоздает то же самое поведение.

По сравнению с этим, другие модели не такие стабильные.
GPT-5.6 Sol упал с 24% до 19%, GPT-5.4 — с 21% до 12%, а GPT-5.5 — с 17% до 5%. Смена языка сразу усилила разрыв.
Передача всего проекта ИИ
Сегодня Cursor позволяет сотням агентов сотрудничать почти неделю, чтобы с нуля написать более 1 миллиона строк кода браузера, распределенных по 1000 файлов.
Anthropic заставила 16 агентов Claude параллельно запускать почти 2000 сессий, в итоге собрав компилятор C на 100 тысяч строк, способный скомпилировать ядро Linux 6.9.
В опубликованных OpenAI пользовательских выборках Codex по май, 70.2% как минимум раз отправляли задачу, оцениваемую в более чем час человеческой работы; 25.6% отправляли задачи, оцениваемые в более чем восемь часов.
Единица, которую люди передают ИИ, меняется от фрагмента кода, бага — на полдня, неделю или даже целый проект.
64% от MirrorCode — это как раз количественная оценка такого «проектного делегирования».
Это показывает, что если цель достаточно четко определена, а результат можно автоматически проверить, передовые модели уже могут самостоятельно выполнить часть средних и крупных программ.
Для каждого, кто уже передает работу ИИ, перемены уже близко:
Раньше вам нужно было следить за каждым написанным им фрагментом кода, теперь же вы, скорее всего, будете проверять, не сбился ли он с пути, только в ключевых точках.
Код будет становиться все дешевле.
А те, кто умеет четко формулировать задачи и проверять результаты, будут становиться все ценнее.
Источники: https://epoch.ai/MirrorCode
Эта статья взята из публикации на WeChat «Синь Чжи Юань», автор: ASI启示录; редактор: Моисей








