Только что Claude Fable 5 снова занял первое место

marsbitОпубликовано 2026-08-04Обновлено 2026-08-04

Введение

Claude Fable 5 возглавил рейтинг MirrorCode, показав абсолютный успех в 64% случаев решения задач по программированию, оставив позади GPT-5.6 Sol с результатом лишь в треть от этого показателя. Что особенно впечатляет, так это устойчивость модели при работе с непопулярными языками: при переходе с Go на Ada успешность выполнения упала всего на 3 процентных пункта (с 64% до 61%), несмотря на то, что обучающих данных по Python в открытом доступе примерно в 230 раз больше, чем по Ada. Это указывает на способность модели не просто запоминать синтаксис, а глубоко понимать логику программы и воссоздавать её функциональность с нуля на любом языке. Бенчмарк MirrorCode представляет собой сложное испытание, в рамках которого модель в изолированной среде должна, анализируя только высокоуровневую документацию и наблюдая за поведением исходной программы, полностью воспроизвести её, пройдя 100% видимых и скрытых тестов. На выполнение задач выделяется до 100 миллиардов токенов и нескольких дней непрерывной работы. Например, воссоздание биотехнологического инструмента `gotree` (16 тыс. строк кода) моделью Claude Opus 4.7 заняло 14 часов и стоило 251 доллар, достигнув 99.95% завершённости, что эквивалентно 2-17 неделям человеческой работы. Тенденция ясна: ИИ переходит от генерации отдельных фрагментов кода к самостоятельному выполнению целых проектов. Такие инструменты, как Cursor и Claude, уже демонстрируют возможности множества агентов, сотрудничающих для написания браузеров и компиляторов...

На этот раз Claude действительно выбил разрыв в рейтинге AI-программирования!

Только что обновленный рейтинг MirrorCode: Claude Fable 5 с абсолютным успехом в 64% снова на вершине.

Следующий за ним GPT-5.6 Sol имеет лишь треть его баллов!

GPT-5.5 на четвертом месте еще хуже. Его результат — всего 10%, и он даже проигрывает своему предшественнику GPT-5.4.

Что еще более удивительно: при использовании таких языков, как Go, с большими ресурсами, процент решений Fable 5 составляет 64%; а при переходе на менее популярный язык Ada результат все еще достигает 61%.

Нужно знать, что в мире open source Python-кода примерно в 230 раз больше, чем Ada.

Но у Fable 5 результат упал всего на 3 процентных пункта.

Это интересно.

Если модель в основном полагается на запоминание синтаксиса и распространенных шаблонов популярных языков, то при переходе на Ada результаты должны были бы ухудшиться.

А текущий результат указывает на другую возможность:

Сильнейшие модели уже освободились от влияния конкретных корпусов данных и начали учиться создавать полноценные программные проекты с нуля.

Застряли на 100% проходимости, предельный тест на 100 миллиардов токенов

Конкретно, полный MirrorCode включает 25 целевых программ, охватывающих Unix-инструменты, интерпретаторы, запросы данных, биоинформатику, криптографию и инструменты сжатия.

Здесь модель помещается в изолированную среду без интернета, без доступа к исходному коду проекта и без возможности скачивания сторонних зависимостей. У нее есть только высокоуровневая документация, часть видимых тестов и оригинальная программа, которую можно вызывать многократно.

Затем она должна постоянно вводить данные в оригинальную программу, наблюдать за выводом, угадывать внутреннюю логику и постепенно писать новую программу с идентичным поведением.

Самый свежий рейтинг выбирает 15 Medium и Large целей. Для каждой цели используются два языка реализации, каждый язык запускается три раза.

И проходимость как видимых, так и скрытых тестов должна достигать 100%, чтобы считаться успешной, 99.9% недостаточно.

Если упущен хотя бы один пограничный случай, весь запуск все равно считается провалом.

Чтобы заставить модель заполнить оставшиеся пробелы, MirrorCode поднял бюджет на один запуск до 100 миллиардов токенов, с максимальным временем непрерывной работы в 7 дней.

В статье упоминается еще более экстремальная задача: модель работала непрерывно 19 дней, затраты на один запуск достигли 2600 долларов.

В течение этих 19 дней модель многократно запускала оригинальную программу, сравнивала результаты, дописывала функционал и снова запускала тесты. При ошибке она искала причину, при несовпадении вывода меняла гипотезу, и после локального успеха переходила к следующему пробелу.

Весь процесс больше похож на отладку, продолжающуюся несколько дней, а не на однократную генерацию.

Пример gotree наиболее нагляден.

Этот инструмент биоинформатики изначально содержал около 16 тысяч строк кода на Go и более 40 команд.

Claude Opus 4.7 потратил 14 часов и 251 доллар, прошел 2000 из 2001 теста, достигнув 99.95% завершенности.

Хотя он пропустил один редкий пограничный случай с обработкой даты в комментариях и был остановлен планкой 100% проходимости MirrorCode, он сжал объем работы, рассчитанный на недели, до нескольких часов:

По оценкам Epoch, если бы не использовался ИИ, инженеру-человеку потребовалось бы от 2 до 17 недель для выполнения той же задачи.

В пустыне корпусов данных Fable 5 потерял всего 3 балла

В статье о MirrorCode использовалась публичная обучающая смесь StarCoder в качестве референса.

В ней Python составляет около 8%, а Ada — всего 0.034%, первый примерно в 230 раз больше второго.

Конечно, мы не можем знать, сколько кода на Ada действительно видели закрытые модели. Но, взяв за референс открытую экосистему, редкость Ada становится достаточно очевидной.

Этот язык в основном используется в аэрокосмической отрасли, оборонном комплексе и других системах с высокими требованиями к безопасности. Сообщество, количество учебных материалов и open source проектов несопоставимо меньше, чем у Python, JavaScript или Go.

И Fable 5 явно не занимается построчным переводом кода с Go на Ada.

Он скорее сначала понимает, как работает оригинальная программа, а затем, на другом языке, воссоздает то же самое поведение.

По сравнению с этим, другие модели не такие стабильные.

GPT-5.6 Sol упал с 24% до 19%, GPT-5.4 — с 21% до 12%, а GPT-5.5 — с 17% до 5%. Смена языка сразу усилила разрыв.

Передача всего проекта ИИ

Сегодня Cursor позволяет сотням агентов сотрудничать почти неделю, чтобы с нуля написать более 1 миллиона строк кода браузера, распределенных по 1000 файлов.

Anthropic заставила 16 агентов Claude параллельно запускать почти 2000 сессий, в итоге собрав компилятор C на 100 тысяч строк, способный скомпилировать ядро Linux 6.9.

В опубликованных OpenAI пользовательских выборках Codex по май, 70.2% как минимум раз отправляли задачу, оцениваемую в более чем час человеческой работы; 25.6% отправляли задачи, оцениваемые в более чем восемь часов.

Единица, которую люди передают ИИ, меняется от фрагмента кода, бага — на полдня, неделю или даже целый проект.

64% от MirrorCode — это как раз количественная оценка такого «проектного делегирования».

Это показывает, что если цель достаточно четко определена, а результат можно автоматически проверить, передовые модели уже могут самостоятельно выполнить часть средних и крупных программ.

Для каждого, кто уже передает работу ИИ, перемены уже близко:

Раньше вам нужно было следить за каждым написанным им фрагментом кода, теперь же вы, скорее всего, будете проверять, не сбился ли он с пути, только в ключевых точках.

Код будет становиться все дешевле.

А те, кто умеет четко формулировать задачи и проверять результаты, будут становиться все ценнее.

Источники: https://epoch.ai/MirrorCode

Эта статья взята из публикации на WeChat «Синь Чжи Юань», автор: ASI启示录; редактор: Моисей

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое Claude Fable 5 и в чем его успех в рейтинге MirrorCode?

AClaude Fable 5 — это модель искусственного интеллекта от Anthropic. В обновленном рейтинге MirrorCode она заняла первое место, достигнув 64% абсолютного успеха в выполнении задач по программированию, что значительно превышает показатели ближайших конкурентов.

QКак работает тестирование MirrorCode и насколько оно строгое?

AMirrorCode — это сложный тест по программированию, включающий 25 целевых программ. Модель помещают в изолированную среду без доступа в интернет и исходным кодом. Ей доступна только документация, часть тестов и возможность вызывать оригинальную программу для анализа. Тестирование считается пройденным только при 100% успешности по всем видимым и скрытым тестам, даже 99.9% считается провалом.

QПочему низкая разница в результатах Fable 5 между Go и Ada важна?

AВ мире открытого исходного кода данных на Python примерно в 230 раз больше, чем на Ada. Однако при переходе с Go на редкий язык Ada производительность Fable 5 упала всего на 3 процентных пункта (с 64% до 61%). Это указывает, что модель не просто запоминает синтаксис популярных языков, а действительно понимает логику программы и способна воссоздать ее функциональность на другом языке, демонстрируя способность 'с нуля' строить программные проекты.

QКакие примеры крупных проектов уже могут создавать современные модели ИИ?

AСовременные модели ИИ способны самостоятельно создавать крупные программные проекты. Например, в Cursor сотни агентов за неделю написали более 1 миллиона строк кода для браузера. Anthropic с помощью 16 агентов Claude создала компилятор C на 10 тысяч строк, способный скомпилировать ядро Linux 6.9. Это показывает переход к 'проектному уровню' делегирования задач.

QКак меняется роль человека в программировании с развитием ИИ, согласно статье?

AСогласно статье, код становится все более доступным и дешевым в создании с помощью ИИ. Роль человека смещается от написания каждой строчки кода к более высокоуровневым задачам: четкой постановке проблемы, проектированию системы и проверке ключевых результатов. Наиболее ценными становятся те, кто может ясно формулировать задачи и проверять итоговые результаты работы ИИ.

Похожее

Бывший руководитель ФБР признал вину в краже криптовалюты на $1 млн

Бывший супервизор ФБР Патрик Стивен Ярох признал себя виновным в хищении криптовалюты на сумму около 1 миллиона долларов. Согласно материалам суда, в период с конца 2024 по начало 2025 года он использовал служебные системы для получения доступа к кошелькам, связанным с враждебным государством, и совершил 10 несанкционированных переводов. Часть средств он разместил на протоколе Suilend для получения дохода. После самостоятельного сообщения о инциденте Ярох был отстранён от должности, уволен, а затем арестован. При его содействии правоохранителям удалось вернуть около 925 000 долларов на контролируемые государством кошельки. В мае, согласно документам, он спрашивал у ChatGPT, как лучше инвестировать миллион долларов. Это не первый случай крипто-преступления среди федеральных агентов. В 2015 году бывший агент УБН Карл М. Форс и бывший агент Секретной службы Шон У. Бриджес были осуждены за хищение биткойнов на сотни тысяч долларов в рамках расследования дела о Silk Road.

cointelegraph7 мин. назад

Бывший руководитель ФБР признал вину в краже криптовалюты на $1 млн

cointelegraph7 мин. назад

AI-технологии превзошли лунную программу «Аполлон», Google сжег 200 миллиардов долларов, поставив на крупнейшую ставку XXI века

Искусственный интеллект приближается к «сингулярности», когда он сможет самостоятельно улучшать себя — это явление известно как рекурсивное самоулучшение (RSI). Крупные технологические компании, такие как Google, инвестируют сотни миллиардов долларов в инфраструктуру ИИ, делая ставку на то, что RSI станет реальностью и радикально снизит затраты на разработку моделей ИИ. Хотя текущие системы, подобные AlphaEvolve от Google, Claude от Anthropic и GPT-5.6 Sol от OpenAI, уже демонстрируют элементы автономного улучшения (оптимизация кода, чипов, исследований), до полного RSI, когда ИИ сможет полностью перепроектировать себя без участия человека, еще далеко. Эксперты, включая специалистов Google DeepMind, предупреждают о рисках, таких как использование продвинутого ИИ для кибератак или создания биологического оружия, и предполагают, что переломный момент может наступить в ближайшие несколько лет (2027-2028). Гонка за RSI — это беспрецедентная научно-технологическая ставка, способная переопределить будущее человечества.

marsbit25 мин. назад

AI-технологии превзошли лунную программу «Аполлон», Google сжег 200 миллиардов долларов, поставив на крупнейшую ставку XXI века

marsbit25 мин. назад

Появилась открытая версия Claude Science: нулевые зависимости, лицензия MIT, 30+ встроенных научных навыков

Представляем OpenAI4S — открытую альтернативу Claude Science с лицензией MIT, разработанную совместной лабораторией Пекинского университета и YuanAI. Проект реализует подход Code-as-Action, позволяя ИИ-агенту выполнять сложные исследовательские задачи: поиск литературы, написание и выполнение кода (Python/R), анализ данных, визуализацию и генерацию отчетов в единой среде с сохраняемым состоянием. Система включает более 30 встроенных Skills для работы с белковыми структурами, молекулярным докингом, анализом одноклеточных данных и другими научными областями. Она поддерживает интеграцию с собственными вычислительными ресурсами (включая GPU) и следует строгой политике отказа от фальсификации данных — все результаты основаны на реальных вычислениях и источниках. OpenAI4S предлагает полную веб-платформу для исследований с версионностью результатов. Проект открыт для вклада сообщества: разработки новых Skills, улучшения архитектуры и расширения функциональности для различных научных дисциплин. Ссылки: GitHub: https://github.com/PKU-YuanGroup/OpenAI4S Демо: https://www.chatexcel.com/homesite/openAI4S

marsbit26 мин. назад

Появилась открытая версия Claude Science: нулевые зависимости, лицензия MIT, 30+ встроенных научных навыков

marsbit26 мин. назад

Продолжит ли биткоин свой боковой тренд? Крупнейшие игроки указывают на конец сентября! Вот подробности

Крупный инвестор на рынке криптовалютных деривативов продал колл-опционы на биткоин на сумму $173 млн, заняв позицию, что цена BTC не превысит $70 000 до 25 сентября. Сделка позволяет инвестору получить премию в размере около $3,03 млн, если прогноз сбудется. Этот шаг отражает ожидания отсутствия значительного краткосрочного роста биткоина и указывает на уровень $70 000 как на ключевое техническое сопротивление. Однако эксперты отмечают, что подобные сделки не всегда служат прямым индикатором будущего движения рынка, поскольку часто являются частью сложных стратегий хеджирования. В ближайшее время на цену BTC также могут повлиять макроэкономические данные из США, политика центробанков и приток средств в биткоин-ETF.

cryptonews.ru32 мин. назад

Продолжит ли биткоин свой боковой тренд? Крупнейшие игроки указывают на конец сентября! Вот подробности

cryptonews.ru32 мин. назад

Для криптообменников РФ создадут СРО

В России создается саморегулируемая организация (СРО) для операторов обмена цифровых валют. Учредительный съезд запланирован на 1 сентября в Москве. Инициатива связана с новым законом «О цифровой валюте и цифровых правах», основные нормы которого вступят в силу с 1 сентября 2026 года. Закон создает регулируемую инфраструктуру для обращения криптовалют, включающую криптообменники и цифровые депозитарии. По словам юриста Андрея Тугарина, у обменников, которые ранее часто работали без четкого юридического статуса, возникает множество практических вопросов, таких как порядок включения в реестр ЦБ, взаимодействие с международным контуром и санкционные риски. Новая СРО призвана стать площадкой для сбора этих вопросов и коммуникации с Банком России. Закон предусматривает переходный период до 1 июля 2027 года, в течение которого участники рынка должны привести свою деятельность в соответствие с новыми требованиями.

cryptonews.ru32 мин. назад

Для криптообменников РФ создадут СРО

cryptonews.ru32 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片