Только что Claude Fable 5 снова занял первое место

marsbitОпубликовано 2026-08-04Обновлено 2026-08-04

Введение

Claude Fable 5 возглавил рейтинг MirrorCode, показав абсолютный успех в 64% случаев решения задач по программированию, оставив позади GPT-5.6 Sol с результатом лишь в треть от этого показателя. Что особенно впечатляет, так это устойчивость модели при работе с непопулярными языками: при переходе с Go на Ada успешность выполнения упала всего на 3 процентных пункта (с 64% до 61%), несмотря на то, что обучающих данных по Python в открытом доступе примерно в 230 раз больше, чем по Ada. Это указывает на способность модели не просто запоминать синтаксис, а глубоко понимать логику программы и воссоздавать её функциональность с нуля на любом языке. Бенчмарк MirrorCode представляет собой сложное испытание, в рамках которого модель в изолированной среде должна, анализируя только высокоуровневую документацию и наблюдая за поведением исходной программы, полностью воспроизвести её, пройдя 100% видимых и скрытых тестов. На выполнение задач выделяется до 100 миллиардов токенов и нескольких дней непрерывной работы. Например, воссоздание биотехнологического инструмента `gotree` (16 тыс. строк кода) моделью Claude Opus 4.7 заняло 14 часов и стоило 251 доллар, достигнув 99.95% завершённости, что эквивалентно 2-17 неделям человеческой работы. Тенденция ясна: ИИ переходит от генерации отдельных фрагментов кода к самостоятельному выполнению целых проектов. Такие инструменты, как Cursor и Claude, уже демонстрируют возможности множества агентов, сотрудничающих для написания браузеров и компиляторов...

На этот раз Claude действительно выбил разрыв в рейтинге AI-программирования!

Только что обновленный рейтинг MirrorCode: Claude Fable 5 с абсолютным успехом в 64% снова на вершине.

Следующий за ним GPT-5.6 Sol имеет лишь треть его баллов!

GPT-5.5 на четвертом месте еще хуже. Его результат — всего 10%, и он даже проигрывает своему предшественнику GPT-5.4.

Что еще более удивительно: при использовании таких языков, как Go, с большими ресурсами, процент решений Fable 5 составляет 64%; а при переходе на менее популярный язык Ada результат все еще достигает 61%.

Нужно знать, что в мире open source Python-кода примерно в 230 раз больше, чем Ada.

Но у Fable 5 результат упал всего на 3 процентных пункта.

Это интересно.

Если модель в основном полагается на запоминание синтаксиса и распространенных шаблонов популярных языков, то при переходе на Ada результаты должны были бы ухудшиться.

А текущий результат указывает на другую возможность:

Сильнейшие модели уже освободились от влияния конкретных корпусов данных и начали учиться создавать полноценные программные проекты с нуля.

Застряли на 100% проходимости, предельный тест на 100 миллиардов токенов

Конкретно, полный MirrorCode включает 25 целевых программ, охватывающих Unix-инструменты, интерпретаторы, запросы данных, биоинформатику, криптографию и инструменты сжатия.

Здесь модель помещается в изолированную среду без интернета, без доступа к исходному коду проекта и без возможности скачивания сторонних зависимостей. У нее есть только высокоуровневая документация, часть видимых тестов и оригинальная программа, которую можно вызывать многократно.

Затем она должна постоянно вводить данные в оригинальную программу, наблюдать за выводом, угадывать внутреннюю логику и постепенно писать новую программу с идентичным поведением.

Самый свежий рейтинг выбирает 15 Medium и Large целей. Для каждой цели используются два языка реализации, каждый язык запускается три раза.

И проходимость как видимых, так и скрытых тестов должна достигать 100%, чтобы считаться успешной, 99.9% недостаточно.

Если упущен хотя бы один пограничный случай, весь запуск все равно считается провалом.

Чтобы заставить модель заполнить оставшиеся пробелы, MirrorCode поднял бюджет на один запуск до 100 миллиардов токенов, с максимальным временем непрерывной работы в 7 дней.

В статье упоминается еще более экстремальная задача: модель работала непрерывно 19 дней, затраты на один запуск достигли 2600 долларов.

В течение этих 19 дней модель многократно запускала оригинальную программу, сравнивала результаты, дописывала функционал и снова запускала тесты. При ошибке она искала причину, при несовпадении вывода меняла гипотезу, и после локального успеха переходила к следующему пробелу.

Весь процесс больше похож на отладку, продолжающуюся несколько дней, а не на однократную генерацию.

Пример gotree наиболее нагляден.

Этот инструмент биоинформатики изначально содержал около 16 тысяч строк кода на Go и более 40 команд.

Claude Opus 4.7 потратил 14 часов и 251 доллар, прошел 2000 из 2001 теста, достигнув 99.95% завершенности.

Хотя он пропустил один редкий пограничный случай с обработкой даты в комментариях и был остановлен планкой 100% проходимости MirrorCode, он сжал объем работы, рассчитанный на недели, до нескольких часов:

По оценкам Epoch, если бы не использовался ИИ, инженеру-человеку потребовалось бы от 2 до 17 недель для выполнения той же задачи.

В пустыне корпусов данных Fable 5 потерял всего 3 балла

В статье о MirrorCode использовалась публичная обучающая смесь StarCoder в качестве референса.

В ней Python составляет около 8%, а Ada — всего 0.034%, первый примерно в 230 раз больше второго.

Конечно, мы не можем знать, сколько кода на Ada действительно видели закрытые модели. Но, взяв за референс открытую экосистему, редкость Ada становится достаточно очевидной.

Этот язык в основном используется в аэрокосмической отрасли, оборонном комплексе и других системах с высокими требованиями к безопасности. Сообщество, количество учебных материалов и open source проектов несопоставимо меньше, чем у Python, JavaScript или Go.

И Fable 5 явно не занимается построчным переводом кода с Go на Ada.

Он скорее сначала понимает, как работает оригинальная программа, а затем, на другом языке, воссоздает то же самое поведение.

По сравнению с этим, другие модели не такие стабильные.

GPT-5.6 Sol упал с 24% до 19%, GPT-5.4 — с 21% до 12%, а GPT-5.5 — с 17% до 5%. Смена языка сразу усилила разрыв.

Передача всего проекта ИИ

Сегодня Cursor позволяет сотням агентов сотрудничать почти неделю, чтобы с нуля написать более 1 миллиона строк кода браузера, распределенных по 1000 файлов.

Anthropic заставила 16 агентов Claude параллельно запускать почти 2000 сессий, в итоге собрав компилятор C на 100 тысяч строк, способный скомпилировать ядро Linux 6.9.

В опубликованных OpenAI пользовательских выборках Codex по май, 70.2% как минимум раз отправляли задачу, оцениваемую в более чем час человеческой работы; 25.6% отправляли задачи, оцениваемые в более чем восемь часов.

Единица, которую люди передают ИИ, меняется от фрагмента кода, бага — на полдня, неделю или даже целый проект.

64% от MirrorCode — это как раз количественная оценка такого «проектного делегирования».

Это показывает, что если цель достаточно четко определена, а результат можно автоматически проверить, передовые модели уже могут самостоятельно выполнить часть средних и крупных программ.

Для каждого, кто уже передает работу ИИ, перемены уже близко:

Раньше вам нужно было следить за каждым написанным им фрагментом кода, теперь же вы, скорее всего, будете проверять, не сбился ли он с пути, только в ключевых точках.

Код будет становиться все дешевле.

А те, кто умеет четко формулировать задачи и проверять результаты, будут становиться все ценнее.

Источники: https://epoch.ai/MirrorCode

Эта статья взята из публикации на WeChat «Синь Чжи Юань», автор: ASI启示录; редактор: Моисей

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое Claude Fable 5 и в чем его успех в рейтинге MirrorCode?

AClaude Fable 5 — это модель искусственного интеллекта от Anthropic. В обновленном рейтинге MirrorCode она заняла первое место, достигнув 64% абсолютного успеха в выполнении задач по программированию, что значительно превышает показатели ближайших конкурентов.

QКак работает тестирование MirrorCode и насколько оно строгое?

AMirrorCode — это сложный тест по программированию, включающий 25 целевых программ. Модель помещают в изолированную среду без доступа в интернет и исходным кодом. Ей доступна только документация, часть тестов и возможность вызывать оригинальную программу для анализа. Тестирование считается пройденным только при 100% успешности по всем видимым и скрытым тестам, даже 99.9% считается провалом.

QПочему низкая разница в результатах Fable 5 между Go и Ada важна?

AВ мире открытого исходного кода данных на Python примерно в 230 раз больше, чем на Ada. Однако при переходе с Go на редкий язык Ada производительность Fable 5 упала всего на 3 процентных пункта (с 64% до 61%). Это указывает, что модель не просто запоминает синтаксис популярных языков, а действительно понимает логику программы и способна воссоздать ее функциональность на другом языке, демонстрируя способность 'с нуля' строить программные проекты.

QКакие примеры крупных проектов уже могут создавать современные модели ИИ?

AСовременные модели ИИ способны самостоятельно создавать крупные программные проекты. Например, в Cursor сотни агентов за неделю написали более 1 миллиона строк кода для браузера. Anthropic с помощью 16 агентов Claude создала компилятор C на 10 тысяч строк, способный скомпилировать ядро Linux 6.9. Это показывает переход к 'проектному уровню' делегирования задач.

QКак меняется роль человека в программировании с развитием ИИ, согласно статье?

AСогласно статье, код становится все более доступным и дешевым в создании с помощью ИИ. Роль человека смещается от написания каждой строчки кода к более высокоуровневым задачам: четкой постановке проблемы, проектированию системы и проверке ключевых результатов. Наиболее ценными становятся те, кто может ясно формулировать задачи и проверять итоговые результаты работы ИИ.

Похожее

Mastercard завершает приобретение BVNK за 1,8 млрд долларов для расширения платежей в стейблкоинах

Mastercard завершила приобретение поставщика инфраструктуры для платежей в стейблкоинах BVNK на сумму 1,8 млрд долларов. Эта стратегическая сделка направлена на расширение возможностей для платежей цифровыми активами по всему миру. Объединив глобальную платежную сеть Mastercard с блокчейн-инфраструктурой BVNK, компания стремится усилить связь между традиционной финансовой экосистемой и цифровыми валютами. Совместная платформа позволит предоставлять услуги по трансграничным бизнес-платежам, выплатам для мерчантов, казначейским операциям, расчетам и платежам токенизированными активами. Банки, платежные провайдеры и финтех-компании получат больше возможностей для интеграции цифровых валют с фиатной платежной инфраструктурой. Это позволит бизнесу осуществлять платежи более эффективно и получить доступ к финансовым услугам на базе блокчейна.

TheNewsCrypto6 мин. назад

Mastercard завершает приобретение BVNK за 1,8 млрд долларов для расширения платежей в стейблкоинах

TheNewsCrypto6 мин. назад

BubbleMaps выявил 25 кошельков, владеющих 19% всего предложения CATE

Аналитическая компания BubbleMaps выяснила, что 25 кошельков контролируют 19% предложения мемкоина CATE, что указывает на высокую концентрацию владения. Токен, который позиционируется через связь с собакой Кабосу (прообразом Dogecoin), купили почти 75 000 трейдеров, причём более 53 500 из них сейчас получают прибыль. Однако аналитики задаются вопросом, как долго инвесторы смогут её удерживать, учитывая риски, связанные с концентрацией крупных держателей. Владелица Кабосу, Ацуко Сато, заявила, что токены CATE не имеют к ней отношения, а её старый пост в Instagram был использован без разрешения для создания ложной ассоциации. Единственным одобренным ею проектом является Own The Doge. Ранее BubbleMaps уже предупреждала о подобных рисках с другими мемкоинами, такими как CASHCAT, CASHDOG и $LAB, где неравномерное распределение или приближение разблокировки токенов ранними инвесторами приводило к резким падениям цен. Текущая ситуация с CATE напоминает эти сценарии, и реакция рядовых инвесторов на данные о концентрации может существенно повлиять на будущее токена.

cryptonews.ru8 мин. назад

BubbleMaps выявил 25 кошельков, владеющих 19% всего предложения CATE

cryptonews.ru8 мин. назад

Генеральный директор Coinbase призывает Сенат принять закон CLARITY на этой неделе

Генеральный директор Coinbase Брайан Армстронг призвал Сенат США принять в текущую неделю закон CLARITY, устанавливающий федеральную нормативную базу для криптовалютного рынка. Он охарактеризовал законопроект как результат двухпартийных усилий, который создаст рабочие места, увеличит налоговые поступления и стимулирует инновации, одновременно обеспечив потребительскую защиту и полномочия правоохранительных органов. Обновлённый проект закона, внесённый сенатором Синтией Луммис, разграничивает полномочия между SEC и CFTC, устанавливает стандарты для бирж и других посредников, а также регулирует банковские операции с цифровыми активами, включая стейблкоины. Поддержку инициативе выразил бывший председатель SEC Пол Аткинс. Кампания Stand With Crypto активизировала давление на законодателей, заявляя, что каждый четвёртый американец владеет криптовалютой и что избиратели отдают предпочтение сторонникам законопроекта. Армстронг представил голосование как выбор между американским регулированием и оттоком индустрии в офшоры.

cryptonews.ru9 мин. назад

Генеральный директор Coinbase призывает Сенат принять закон CLARITY на этой неделе

cryptonews.ru9 мин. назад

Криптосоветник Бессента Тайлер Уильямс покинул Министерство финансов, поскольку время для голосования по законопроекту CLARITY истекло

Тайлер Уильямс, главный советник министра финансов по цифровым активам, покинул правительство США перед августовским перерывом Сената, не дождавшись голосования по ключевому законопроекту индустрии — CLARITY Act. Уильямс, ранее работавший в Galaxy Digital, занимался разработкой политики в области цифровых активов, включая отчет Белого дома и сам закон CLARITY. Закон CLARITY Act направлен на распределение надзора за цифровыми активами между SEC и CFTC и защиту разработчиков блокчейна. Однако его принятие до перерыва маловероятно: для продвижения необходимо 60 голосов в Сенате, но семь сенаторов-демократов блокируют законопроект из-за этических и security-проблем. Вероятность принятия в 2026 году, по оценке Galaxy Research, упала с 50% до 30%. Уход Уильямса происходит на фоне отъезда и других известных сторонников криптоиндустрии из Вашингтона. Несмотря на потенциально негативную рыночную реакцию в случае провала закона, его поддерживают крупные финансовые компании, включая BlackRock и Fidelity.

cryptonews.ru12 мин. назад

Криптосоветник Бессента Тайлер Уильямс покинул Министерство финансов, поскольку время для голосования по законопроекту CLARITY истекло

cryptonews.ru12 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片