Только что Claude Fable 5 снова занял первое место

marsbitОпубликовано 2026-08-04Обновлено 2026-08-04

Введение

Claude Fable 5 возглавил рейтинг MirrorCode, показав абсолютный успех в 64% случаев решения задач по программированию, оставив позади GPT-5.6 Sol с результатом лишь в треть от этого показателя. Что особенно впечатляет, так это устойчивость модели при работе с непопулярными языками: при переходе с Go на Ada успешность выполнения упала всего на 3 процентных пункта (с 64% до 61%), несмотря на то, что обучающих данных по Python в открытом доступе примерно в 230 раз больше, чем по Ada. Это указывает на способность модели не просто запоминать синтаксис, а глубоко понимать логику программы и воссоздавать её функциональность с нуля на любом языке. Бенчмарк MirrorCode представляет собой сложное испытание, в рамках которого модель в изолированной среде должна, анализируя только высокоуровневую документацию и наблюдая за поведением исходной программы, полностью воспроизвести её, пройдя 100% видимых и скрытых тестов. На выполнение задач выделяется до 100 миллиардов токенов и нескольких дней непрерывной работы. Например, воссоздание биотехнологического инструмента `gotree` (16 тыс. строк кода) моделью Claude Opus 4.7 заняло 14 часов и стоило 251 доллар, достигнув 99.95% завершённости, что эквивалентно 2-17 неделям человеческой работы. Тенденция ясна: ИИ переходит от генерации отдельных фрагментов кода к самостоятельному выполнению целых проектов. Такие инструменты, как Cursor и Claude, уже демонстрируют возможности множества агентов, сотрудничающих для написания браузеров и компиляторов...

На этот раз Claude действительно выбил разрыв в рейтинге AI-программирования!

Только что обновленный рейтинг MirrorCode: Claude Fable 5 с абсолютным успехом в 64% снова на вершине.

Следующий за ним GPT-5.6 Sol имеет лишь треть его баллов!

GPT-5.5 на четвертом месте еще хуже. Его результат — всего 10%, и он даже проигрывает своему предшественнику GPT-5.4.

Что еще более удивительно: при использовании таких языков, как Go, с большими ресурсами, процент решений Fable 5 составляет 64%; а при переходе на менее популярный язык Ada результат все еще достигает 61%.

Нужно знать, что в мире open source Python-кода примерно в 230 раз больше, чем Ada.

Но у Fable 5 результат упал всего на 3 процентных пункта.

Это интересно.

Если модель в основном полагается на запоминание синтаксиса и распространенных шаблонов популярных языков, то при переходе на Ada результаты должны были бы ухудшиться.

А текущий результат указывает на другую возможность:

Сильнейшие модели уже освободились от влияния конкретных корпусов данных и начали учиться создавать полноценные программные проекты с нуля.

Застряли на 100% проходимости, предельный тест на 100 миллиардов токенов

Конкретно, полный MirrorCode включает 25 целевых программ, охватывающих Unix-инструменты, интерпретаторы, запросы данных, биоинформатику, криптографию и инструменты сжатия.

Здесь модель помещается в изолированную среду без интернета, без доступа к исходному коду проекта и без возможности скачивания сторонних зависимостей. У нее есть только высокоуровневая документация, часть видимых тестов и оригинальная программа, которую можно вызывать многократно.

Затем она должна постоянно вводить данные в оригинальную программу, наблюдать за выводом, угадывать внутреннюю логику и постепенно писать новую программу с идентичным поведением.

Самый свежий рейтинг выбирает 15 Medium и Large целей. Для каждой цели используются два языка реализации, каждый язык запускается три раза.

И проходимость как видимых, так и скрытых тестов должна достигать 100%, чтобы считаться успешной, 99.9% недостаточно.

Если упущен хотя бы один пограничный случай, весь запуск все равно считается провалом.

Чтобы заставить модель заполнить оставшиеся пробелы, MirrorCode поднял бюджет на один запуск до 100 миллиардов токенов, с максимальным временем непрерывной работы в 7 дней.

В статье упоминается еще более экстремальная задача: модель работала непрерывно 19 дней, затраты на один запуск достигли 2600 долларов.

В течение этих 19 дней модель многократно запускала оригинальную программу, сравнивала результаты, дописывала функционал и снова запускала тесты. При ошибке она искала причину, при несовпадении вывода меняла гипотезу, и после локального успеха переходила к следующему пробелу.

Весь процесс больше похож на отладку, продолжающуюся несколько дней, а не на однократную генерацию.

Пример gotree наиболее нагляден.

Этот инструмент биоинформатики изначально содержал около 16 тысяч строк кода на Go и более 40 команд.

Claude Opus 4.7 потратил 14 часов и 251 доллар, прошел 2000 из 2001 теста, достигнув 99.95% завершенности.

Хотя он пропустил один редкий пограничный случай с обработкой даты в комментариях и был остановлен планкой 100% проходимости MirrorCode, он сжал объем работы, рассчитанный на недели, до нескольких часов:

По оценкам Epoch, если бы не использовался ИИ, инженеру-человеку потребовалось бы от 2 до 17 недель для выполнения той же задачи.

В пустыне корпусов данных Fable 5 потерял всего 3 балла

В статье о MirrorCode использовалась публичная обучающая смесь StarCoder в качестве референса.

В ней Python составляет около 8%, а Ada — всего 0.034%, первый примерно в 230 раз больше второго.

Конечно, мы не можем знать, сколько кода на Ada действительно видели закрытые модели. Но, взяв за референс открытую экосистему, редкость Ada становится достаточно очевидной.

Этот язык в основном используется в аэрокосмической отрасли, оборонном комплексе и других системах с высокими требованиями к безопасности. Сообщество, количество учебных материалов и open source проектов несопоставимо меньше, чем у Python, JavaScript или Go.

И Fable 5 явно не занимается построчным переводом кода с Go на Ada.

Он скорее сначала понимает, как работает оригинальная программа, а затем, на другом языке, воссоздает то же самое поведение.

По сравнению с этим, другие модели не такие стабильные.

GPT-5.6 Sol упал с 24% до 19%, GPT-5.4 — с 21% до 12%, а GPT-5.5 — с 17% до 5%. Смена языка сразу усилила разрыв.

Передача всего проекта ИИ

Сегодня Cursor позволяет сотням агентов сотрудничать почти неделю, чтобы с нуля написать более 1 миллиона строк кода браузера, распределенных по 1000 файлов.

Anthropic заставила 16 агентов Claude параллельно запускать почти 2000 сессий, в итоге собрав компилятор C на 100 тысяч строк, способный скомпилировать ядро Linux 6.9.

В опубликованных OpenAI пользовательских выборках Codex по май, 70.2% как минимум раз отправляли задачу, оцениваемую в более чем час человеческой работы; 25.6% отправляли задачи, оцениваемые в более чем восемь часов.

Единица, которую люди передают ИИ, меняется от фрагмента кода, бага — на полдня, неделю или даже целый проект.

64% от MirrorCode — это как раз количественная оценка такого «проектного делегирования».

Это показывает, что если цель достаточно четко определена, а результат можно автоматически проверить, передовые модели уже могут самостоятельно выполнить часть средних и крупных программ.

Для каждого, кто уже передает работу ИИ, перемены уже близко:

Раньше вам нужно было следить за каждым написанным им фрагментом кода, теперь же вы, скорее всего, будете проверять, не сбился ли он с пути, только в ключевых точках.

Код будет становиться все дешевле.

А те, кто умеет четко формулировать задачи и проверять результаты, будут становиться все ценнее.

Источники: https://epoch.ai/MirrorCode

Эта статья взята из публикации на WeChat «Синь Чжи Юань», автор: ASI启示录; редактор: Моисей

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое Claude Fable 5 и в чем его успех в рейтинге MirrorCode?

AClaude Fable 5 — это модель искусственного интеллекта от Anthropic. В обновленном рейтинге MirrorCode она заняла первое место, достигнув 64% абсолютного успеха в выполнении задач по программированию, что значительно превышает показатели ближайших конкурентов.

QКак работает тестирование MirrorCode и насколько оно строгое?

AMirrorCode — это сложный тест по программированию, включающий 25 целевых программ. Модель помещают в изолированную среду без доступа в интернет и исходным кодом. Ей доступна только документация, часть тестов и возможность вызывать оригинальную программу для анализа. Тестирование считается пройденным только при 100% успешности по всем видимым и скрытым тестам, даже 99.9% считается провалом.

QПочему низкая разница в результатах Fable 5 между Go и Ada важна?

AВ мире открытого исходного кода данных на Python примерно в 230 раз больше, чем на Ada. Однако при переходе с Go на редкий язык Ada производительность Fable 5 упала всего на 3 процентных пункта (с 64% до 61%). Это указывает, что модель не просто запоминает синтаксис популярных языков, а действительно понимает логику программы и способна воссоздать ее функциональность на другом языке, демонстрируя способность 'с нуля' строить программные проекты.

QКакие примеры крупных проектов уже могут создавать современные модели ИИ?

AСовременные модели ИИ способны самостоятельно создавать крупные программные проекты. Например, в Cursor сотни агентов за неделю написали более 1 миллиона строк кода для браузера. Anthropic с помощью 16 агентов Claude создала компилятор C на 10 тысяч строк, способный скомпилировать ядро Linux 6.9. Это показывает переход к 'проектному уровню' делегирования задач.

QКак меняется роль человека в программировании с развитием ИИ, согласно статье?

AСогласно статье, код становится все более доступным и дешевым в создании с помощью ИИ. Роль человека смещается от написания каждой строчки кода к более высокоуровневым задачам: четкой постановке проблемы, проектированию системы и проверке ключевых результатов. Наиболее ценными становятся те, кто может ясно формулировать задачи и проверять итоговые результаты работы ИИ.

Похожее

Индекс потребительских расходов PCE в США в июле вырос на 3,7% в годовом исчислении, что дает ФРС пространство для сохранения ставок

Инфляция в США по индексу PCE в июле оставалась высокой: общий показатель вырос на 3,7% в годовом выражении, базовый (без учета продуктов питания и энергоносителей) — на 3,3%. Хотя рост цен замедлился, он все еще значительно превышает целевой показатель ФРС в 2%. Личные потребительские расходы в номинальном выражении выросли на 0,2%, но с поправкой на инфляцию остались неизменными, что указывает на давление на реальную покупательную способность. Темпы роста доходов замедлились. Эти данные, наряду с признаками охлаждения экономики, дают Федеральной резервной системе больше оснований для сохранения текущей процентной ставки. Теперь внимание рынка приковано к предстоящему выступлению председателя ФРС Джерома Пауэлла на симпозиуме в Джексон-Хоуле, где могут прояснить дальнейшие шаги денежно-кредитной политики.

marsbit4 мин. назад

Индекс потребительских расходов PCE в США в июле вырос на 3,7% в годовом исчислении, что дает ФРС пространство для сохранения ставок

marsbit4 мин. назад

Экс-директор по ИИ NVIDIA изобретает новую архитектуру, превосходящую Transformer: физический ИИ с контекстом в 5 триллионов способен смоделировать всю Вселенную

Потрясающая разработка: компания Accelerated Understanding, основанная бывшим директором по ИИ Nvidia Анимой Анандкумар и ее мужем, представляет революционную модель «Физический ИИ», способную предсказывать эволюцию физических систем в четырех измерениях (3D-пространство + время). Ключевые особенности: 1. **Новая архитектура:** Вместо стандартного Transformer используется «нейронный оператор» (Neural Operator), созданный специально для работы с непрерывными физическими полями и законами. 2. **Беспрецедентный контекст:** Модель работает с контекстом длиной до 5 триллионов токенов для вывода, что в миллионы раз больше, чем у современных LLM. Это позволяет выполнять **одноэтапный вывод** полных 4D-траекторий сложных систем (например, атмосферных потоков) без разбиения на части. 3. **Универсальность:** Одна модель способна решать задачи из разных областей физики, так как изучает их фундаментальные законы. 4. **Реальный мир как ориентир:** Система создает замкнутый цикл «симуляция → сравнение с реальными данными → улучшение модели», выступая в роли валидатора реальности. Основатели отказались от заманчивого предложения Джеффа Безоса (35% акций, $20+ млрд финансирования), чтобы независимо реализовать свое видение. Предполагается, что проект тайно поддерживает NVIDIA. Этот прорыв знаменует сдвиг парадигмы от генерации текстов и изображений к прямому моделированию и оптимизации физического мира.

marsbit6 мин. назад

Экс-директор по ИИ NVIDIA изобретает новую архитектуру, превосходящую Transformer: физический ИИ с контекстом в 5 триллионов способен смоделировать всю Вселенную

marsbit6 мин. назад

Быстрый обзор финансового отчета Nvidia: квартальная выручка скоро превысит 100 миллиардов долларов, в следующем году рост может составить еще 70%

Финансовый отчет NVIDIA за второй квартал 2027 финансового года показал рекордные результаты: выручка достигла 96,22 млрд долларов, увеличившись на 106% в годовом исчислении. Некоторое значение по GAAP прибыль составила 53,95 млрд долларов, увеличившись на 118%. Компания ожидает, что выручка в третьем квартале достигнет 108 млрд долларов, впервые превысив порог в 100 млрд долларов за квартал. Самой поразительной новостью стал прогноз компании: ожидается, что выручка в 2028 финансовом году вырастет примерно на 70%, что значительно превышает рыночные ожидания в 45%. Этот рост ожидается даже без учета доходов от центров обработки данных в Китае и в условиях ограниченных поставок, что указывает на то, что основной проблемой сейчас является не спрос, а возможности цепочки поставок. Основным драйвером роста остается бизнес центров обработки данных, выручка которого составила 89 млрд долларов (рост на 117%), на его долю приходится более 90% от общей выручки. Спрос по-прежнему в основном формируется за счет капитальных затрат крупных облачных провайдеров, таких как Amazon, Microsoft, Google и Meta. NVIDIA подтвердила начало полномасштабного производства и поставок своей новой платформы Vera Rubin для суперкомпьютеров уровня стойки, предназначенной для ИИ. Ожидается, что в третьем квартале она обеспечит около 20% выручки бизнеса центров обработки данных. По словам генерального директора Дженсен Хуанга, темпы ее внедрения станут самыми быстрыми в истории компании. Несмотря на ускорение спроса на вычисления для ИИ, в том числе для логического вывода, и агрессивные планы капитальных затрат технологических гигантов, предложение остается основным ограничивающим фактором роста. NVIDIA расширяет свою роль, сотрудничая с финансовыми институтами для мобилизации капитала и заранее резервируя ресурсы для инфраструктуры, чтобы преодолеть эти ограничения. Переход к квартальной выручке в 100 млрд долларов знаменует собой новый этап для NVIDIA, а амбициозный прогноз роста на 70% предполагает, что это лишь начало следующей фазы ее расширения.

Odaily星球日报9 мин. назад

Быстрый обзор финансового отчета Nvidia: квартальная выручка скоро превысит 100 миллиардов долларов, в следующем году рост может составить еще 70%

Odaily星球日报9 мин. назад

Американцы держат биткоин чаще, чем золото, но почему это не считается победой?

Статистика показывает, что в США 49,6 млн взрослых (18,6%) владеют биткоином, в то время как золото имеют 28,8 млн (10,8%). Это указывает на сдвиг в предпочтениях инвесторов. Владельцами 42% мирового предложения биткоина являются американцы, включая компании и правительство (последнее владеет 328 372 BTC). Макроэкономический контекст: 19 августа Минфин США объявил о расширении программы выкупа долгосрочных облигаций для поддержки ликвидности. Это привело к ослаблению доллара и одновременному росту цен на золото и биткоин, демонстрируя, что они могут выступать как альтернативы фиатной валюте. Важным индикатором является соотношение биткоина к золоту, которое, по мнению экспертов, может быть опережающим сигналом. На текущий тренд также влияют структурные факторы: терпимость к слабому доллару и развитие искусственного интеллекта, которое направляет капитал в невоспроизводимые активы. Однако высокая доля владения биткоином не означает победы над золотом по рыночной капитализации. Суть в изменении траектории: биткоин постепенно превращается из спекулятивного актива для розничных инвесторов в инструмент резервирования для компаний и государств — роль, традиционно принадлежавшую золоту. Ключевыми факторами для подтверждения этого тренда станут дальнейшая динамика курса доллара, возможное расширение программы выкута Минфина и устойчивый рост соотношения биткоина к золоту.

marsbit9 мин. назад

Американцы держат биткоин чаще, чем золото, но почему это не считается победой?

marsbit9 мин. назад

Инфляция не улучшилась. Поддержит ли Уорш повышение ставок в пятницу?

В среду США опубликовали данные по инфляции за июль: индекс PCE вырос на 3,7% в годовом исчислении, оставаясь неизменным с июня и значительно превышая целевой показатель ФРС в 2%. Рост ВВП во втором квартале замедлился до 1,5%, а реальные потребительские расходы в июле не изменились. Экономисты ожидали небольшого снижения инфляции, поэтому её стабильность повысила вероятности повышения ставки ФРС в сентябре до примерно 44%. Инфляция остается высокой уже более пяти лет, что усиливает давление на ФРС для ужесточения политики. Хотя некоторые факторы, такие как снижение напряженности на Ближнем Востоке, способствовали отступлению инфляции с пиковых значений, новые торговые войны (например, с Канадой) и высокие цены на энергию создают дополнительные риски. Экономика показывает смешанные сигналы: с одной стороны, сильный рост потребительских расходов и инвестиций в бизнес, особенно в сферу ИИ, а с другой — замедление общего ВВП из-за резкого увеличения импорта. Реальные доходы населения практически не растут, что подрывает потребительскую уверенность. Внимание сейчас приковано к предстоящей речи председателя ФРС Кевина Уорша в Джексон-Хоул, где он может дать сигналы относительно дальнейшей денежно-кредитной политики. С приближением промежуточных выборов проблема высоких цен становится центральной темой политической повестки.

marsbit54 мин. назад

Инфляция не улучшилась. Поддержит ли Уорш повышение ставок в пятницу?

marsbit54 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

2.0k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片