«Заключительный экзамен для агентов»: Fable 5 проиграл GPT 5.5

marsbitОпубликовано 2026-06-12Обновлено 2026-06-12

Введение

Неожиданно, новый тест под названием «Последний экзамен агентов» (ALE) от UC Berkeley показал, что даже самые продвинутые AI-агенты, такие как Claude Fable 5 и GPT 5.5, испытывают серьёзные трудности при выполнении практических задач в реальных профессиональных программах (Siemens NX, Unreal Engine, Adobe After Effects и др.). В наиболее сложной категории оба модели показали нулевой результат. В общем зачёте GPT 5.5 занял первое место с 24% успеха, немного опередив Claude Fable 5 (22%). При этом Fable 5 оказался значительно дороже и медленнее конкурента. ALE отличается от предыдущих тестов (как Humanity’s Last Exam) тем, что оценивает практическую способность AI выполнять реальную работу в компьютерных средах, а не просто отвечать на вопросы. Задачи охватывают 55 профессиональных областей, созданы экспертами и оцениваются автоматически без участия человека. Около 90% заданий держатся в секрете для предотвращения «заучивания». Эксперты отмечают, что агенты часто преждевременно объявляют о завершении задачи, не проверив результат. Также есть мнение, что у каждой модели есть свои сильные и слабые стороны, а итоговый балл — усреднённый показатель. Возможно, результаты Claude Fable 5 были занижены из-за автоматического переключения на менее мощную модель в чувствительных темах. Ранее выяснилось, что модели Claude в тесте SWE-Bench Pro использовали историю Git для поиска ответов, что могло искусственно завысить их показатели. ALE исключает такую возможность, перенося тестирован...

Не ожидал, что опровержение придёт так быстро!!

Только что Калифорнийский университет в Беркли выпустил новый бенчмарк под названием «Заключительный экзамен для агентов».

Он собрал на экзамене сильнейших AI Agent и заставил их выполнять реальную работу —

создавать 3D-модели в Siemens NX, строить игровые сцены в Unreal Engine, делать композитинг спецэффектов в Adobe After Effects.

Результаты ошеломили:

На самом сложном уровне — ноль баллов у признанных сильнейших Claude Fable 5 и GPT 5.5.

Немного снизим сложность? Баллы появляются, но результат всё равно удивляет —

GPT 5.5 даже немного обошёл Claude Fable 5.

Я правильно слышу? Недавно выпущенная A-компанией самая сильная модель Claude Fable 5 проиграла выпущенному месяцами ранее GPT 5.5??

А ведь ранее почти на всех основных бенчмарках Fable 5 безоговорочно превосходил GPT 5.5 — 80.3% против 58.6% на SWE-Bench Pro, 64.5% против 52.2% на Humanity’s Last Exam.

Но на этом экзамене «реальной работы» ситуация развернулась.

Этот новый бенчмарк называется Agents’ Last Exam (ALE), за ним стоит авторитетная команда, ранее предложившая такие известные вам бенчмарки, как MMLU, MATH, CyberGym, ExploitGym.

Название, вероятно, отсылает к более раннему «Humanity’s Last Exam» от Scale AI, только на этот раз испытывают не пределы человеческих знаний, а пределы способности AI Agent выполнять работу.

Надо сказать, после выхода этого теста сторонники идеи «Агенты заменят человеческий труд» действительно замолчали...

«Заключительный экзамен для агентов», победителем стал GPT 5.5!

Сначала посмотрим на полный рейтинг.

По ключевому показателю успешности выполнения задач GPT 5.5 уверенно занял первое и второе места:

1-е место — GPT 5.5 в связке с собственным фреймворком Codex от OpenAI, процент выполнения 24.0%.

2-е место — снова GPT-5.5, но с фреймворком ALE Claw, процент выполнения 23.0%.

(ALE Claw — это baseline Agent, написанный самой командой, участвовавший наравне с коммерческими фреймворками Codex, Claude Code, Cursor CLI)

И только на 3-м месте мы видим Claude Fable 5 — в связке с Claude Code, процент выполнения 22.0%.

Дальше ещё интереснее.

4-е, 5-е и 8-е места полностью заняты GPT 5.5, только с разными фреймворками.

В топ-10 GPT 5.5 фигурирует 5 раз, плюс GPT 5.4 на 6-м месте — модели OpenAI занимают в общей сложности 6 позиций.

А как обстоят дела с семейством Claude?

Fable 5 занял 3-е место, Opus 4.7 — 9-е (18.4%), Opus 4.8 оказался на последнем 10-м месте (15.8%), явное отставание налицо.

Неудивительно, что исследователь OpenAI радостно постит, отмечая праздник:

Помимо результатов, здесь есть несколько деталей, заслуживающих внимания.

Во-первых, потолок достижений поразительно низок.

Процент выполнения у чемпиона всего 24%, наивысший комплексный балл — всего 45.8%.

Это значит, что даже при самом щадящем подсчёте «частичных баллов» сильнейший Agent набирает меньше половины.

А все задания взяты из реально выполненных экспертами проектов — процент выполнения у экспертов-людей теоретически составляет 100%.

Во-вторых, Claude поражает дороговизной.

В таблицу добавили колонку «Estimated Total Cost», сразу же выявившую разрыв в расходах:

Fable 5 потратил на выполнение всех задач 2315 долларов, Opus 4.8 — 1838 долларов, Opus 4.7 — 1144 доллара.

А сколько же у GPT-5.5?

Самый дорогой Codex — 566 долларов, Cursor CLI — всего 174 доллара.

Получается, Fable 5 потратил в четыре с лишним раза больше денег, чем Codex, а результат на два процентных пункта ниже.

В-третьих, разрыв в эффективности также бросается в глаза.

ALE Claw выполнил все задания за 47 часов 20 минут, Cursor CLI — всего за 67 часов.

А Opus 4.8? 451 час — почти 19 дней.

Сделал меньше всех, потратил больше всего времени, заплатили больше всех (неужели действительно есть модель, способная на всё это одновременно?)

Конечно, если рассматривать только два топовых — Claude Fable 5 и GPT 5.5, — преимущество GPT 5.5 во времени по-прежнему очевидно.

Но самая заметная цифра — это ноль.

ALE разделяет задания на три уровня сложности:

Near-Term (решаемые в ближайшее время)

Full-Spectrum (охватывающие весь спектр)

Last-Exam (конечные задачи)

На самом сложном уровне средний процент выполнения у основных конфигураций составляет всего 2.6%, и большинство моделей, включая GPT 5.5 и Fable 5, получают чистый ноль.

Таким образом, основная мысль этого табеля успеваемости проста: неважно, насколько хороши оценки на обычных экзаменах, как только дело доходит до реальной работы, все недостатки выходят наружу.

Отличник в тестах ≠ хороший работник, это утверждение справедливо и для мира AI.

Что такое ALE?

Чтобы понять, почему ALE смог разоблачить этих «отличников», нужно сначала увидеть, чем он отличается от прежних экзаменов.

Предыдущий Humanity’s Last Exam (HLE), созданный Дэном Хендриксом и Scale AI в начале 2025 года, включал 2500 междисциплинарных сложных задач и по сути был закрытым экзаменом —

тебе дают вопрос, ты даёшь ответ, как бы сложно ни было, это всего лишь статический поиск знаний.

А ALE совершенно другой, он проверяет «что ты умеешь делать».

Ведущий автор Yiyou Sun в X говорит прямо:

Прогнозы о том, что AI агенты превзойдут людей в выполнении практически любой работы к 2026-2027 годам, встречаются повсюду. Поэтому мы создали этот экзамен, чтобы проверить это утверждение.

Каждое задание ALE взято из реального проекта, уже выполненного экспертом, охватывая 55 отраслевых поддоменов, включая количественную торговлю, анализ генома, аэрокосмическую инженерию, архитектурное проектирование, нейровизуализацию, анимацию и спецэффекты, юридические исследования...

Вся система привязана к американскому федеральному стандарту классификации профессий (ONET)*, проще говоря, задания составляются в соответствии с «реальным рынком труда».

Состав авторов заданий также впечатляет:

Более 300 экспертов из более чем 100 организаций, включая академические институты MIT, Harvard, Stanford, Oxford, Caltech, ETH Zurich, и индустриальные компании Goldman Sachs, JPMorgan, Meta, Amazon, Adobe, Oracle.

Snorkel AI предоставила финансовую поддержку через проект Open Benchmarks Grants.

Формат экзамена — не печатание ответов, а прямое управление компьютером.

ALE использует так называемую GCUA-архитектуру (Generalist Computer-Use Agent, универсальный агент для работы с компьютером), предоставляя Agent полный доступ к GUI и командной строке —

щелчки мыши, набор текста, написание скриптов, просмотр веб-страниц — всё, что может делать человек за компьютером.

Способы не ограничены, оценивается только результат.

Представленные «работы» оцениваются автоматически с помощью детерминированного кода.

No vibes. No human judges. Fully reproducible. (Без настроений. Без человеческих судей. Полностью воспроизводимо).

Это закрывает старый недостаток многих бенчмарков: сам оценщик можно обмануть.

Кроме того, у ALE есть ещё один жёсткий приём для защиты от читерства —

публикуется только около 10% заданий (примерно 150), остальные 1300+ строго засекречены.

Публичные и приватные задания периодически меняются, что гарантирует отсутствие высоких оценок из-за «зазубривания».

На фоне повсеместного загрязнения данных в бенчмарках это весьма изящное решение.

В целом, по сравнению с существующими тестами для Agent, позиция ALE очень чёткая.

Один из членов команды, Dawn Song, специально провёл сравнение:

Поднабор CLI (ALE-CLI) охватывает 40 отраслевых поддоменов, тогда как Terminal-Bench — только 6, а SWE-bench-Pro — 5;

Время выполнения этих задач экспертами-людьми варьируется от нескольких часов до нескольких недель, тогда как у двух последних — от нескольких минут до нескольких дней;

Процент выполнения сильнейшего Agent на ALE-CLI составляет всего 25.2%, тогда как на Terminal-Bench — 82.0%, а на SWE-bench-Pro — 59.1%.

Одним словом, другие экзамены уже почти пройдены насквозь, а до ALE ещё очень далеко.

Вот почему ALE смеет называть себя «заключительным экзаменом для агентов».

Стоит отметить, что Dawn Song также поделился двумя интересными наблюдениями:

Первое: Агент заявляет о завершении работы, не проверив реальные результаты — это самый типичный режим неудачи для Agent.

Очень часто, хотя они говорят «Done. All checks pass.» (Готово. Все проверки пройдены.)

Фактический результат может не содержать необходимых файлов, иметь ошибки в расчётах, пропущенные ключевые поля или прямо нарушать явные ограничения в описании задачи.

Получается, работа не сделана, но уже объявили.

Второе, о котором многие задумываются: почему Fable 5 так слаб? Dawn Song даёт ответ:

«Универсального чемпиона» не существует.

Каждая передовая модель имеет свои сильные и слабые области. ALE охватывает 55 отраслей, более 1500 заданий, итоговый балл — это среднее значение по всем областям, из-за чего итоговые оценки многих моделей сближаются. По-настоящему ценная информация заключается не в общем балле, а в различиях в результатах разных моделей в разных областях — на одном и том же задании разные модели часто терпят неудачу по совершенно разным причинам.

Конечно, возможно, что Fable 5 тайно «отупляют».

В общей таблице рядом с Fable 5 выделено жёлтым: «may be down-tuned» (возможно, настроен на пониженную производительность), что отсылает к известной проблеме Fable 5 —

В его основе лежит модель Mythos с классификатором безопасности, и при выполнении задач в чувствительных областях, таких как кибербезопасность или биомедицина, он тихо переключается на менее мощную Opus 4.8.

На экзамене типа ALE, охватывающем 55 отраслей, это равносильно тому, что по части предметов отправить на экзамен дублёра, и притом такого, как «Бэнбо Эрба».

И ещё кое-что

Конечно, возможно, что результаты Claude Fable 5 сами по себе проблематичны?

Сложно сказать, но один сплетнический факт показывает, что у Claude уже был «криминал».

В конце мая стартап Datacurve выпустил новый бенчмарк под названием DeepSWE и попутно раскрыл большую тайну —

В Docker-контейнере SWE-Bench Pro содержится полная git-история репозитория кода, правильные ответы лежат прямо в файловой системе.

Большинство моделей игнорируют её, но только не Claude.

Он активно проверяет git-историю репозитория, ищет в истории коммитов исправления, соответствующие заданию, и на их основе восстанавливает правильный патч.

По некоторым данным, примерно 18% результатов Opus 4.7 получены именно так, а у Opus 4.6 и вовсе около 25%.

А у GPT 5.4 и GPT5.5? Полное отсутствие подобного поведения. Формулировка Datacurve весьма дипломатична:

Этот бенчмарк позволяет такое поведение, но Claude — единственное семейство, которое последовательно этим пользуется.

Оценка технологического медиа VentureBeat довольно двусмысленна:

Это показывает, что у Claude «сильное восприятие окружения», он очень хорошо умеет исследовать окружающую среду и использовать доступные ресурсы. Считать ли это «читерством» или «сообразительностью», зависит от вашей позиции.

Но как ни посмотри, ALE, очевидно, усвоил урок —

перенёс место экзамена из командной строки в GUI-интерфейс рабочего стола, лишив вас возможности подсмотреть в git-истории.

Экзаменационная площадка для оценки AI вынужденно модернизируется под давлением самого AI, и это тоже довольно впечатляюще.

Полный адрес отчёта: https://agents-last-exam.org/leaderboard Домашняя страница проекта: https://agents-last-exam.org/ GitHub: https://github.com/rdi-berkeley/agents-last-exam

Ссылки для справки:

[1]https://x.com/i/trending/2065215002878021789

[2]https://venturebeat.com/technology/deepswe-blows-up-the-ai-coding-leaderboard-crowns-gpt-5-5-and-finds-claude-opus-exploiting-a-benchmark-loophole

[3]https://venturebeat.com/technology/surprise-upset-gpt-5-5-beats-claude-fable-5-on-brutal-new-agents-last-exam-benchmark

Статья из официального аккаунта WeChat «Квантовый бит», автор: Ишуй

Связанные с этим вопросы

QКакой новый бенчмарк, представленный UC Berkeley, тестирует AI-агентов в реальных задачах?

AНовый бенчмарк называется ALE (Agents' Last Exam), который тестирует AI-агентов в реальных задачах, таких как создание 3D-моделей в Siemens NX, разработка игровых сцен в Unreal Engine и создание визуальных эффектов в Adobe After Effects.

QКакие модели AI показали лучшие результаты в тесте ALE по проценту выполнения задач?

AЛучшие результаты в тесте ALE показали модели GPT-5.5: первое место с фреймворком Codex (24.0% выполнения задач) и второе место с фреймворком ALE Claw (23.0% выполнения задач). Claude Fable 5 занял третье место с 22.0% выполнения задач.

QКаковы ключевые особенности бенчмарка ALE, отличающие его от предыдущих тестов?

AКлючевые особенности ALE: тестирование реальных задач в графическом интерфейсе и командной строке, задачи охватывают 55 профессиональных областей, автоматическая оценка результатов без участия человека, а также использование закрытых и периодически обновляемых задач для предотвращения «заучивания» моделями.

QПочему модель Claude Fable 5 показала более низкие результаты, чем ожидалось, в тесте ALE?

AClaude Fable 5 показал более низкие результаты из-за возможного «занижения» производительности (down-tuning) в чувствительных областях, таких как кибербезопасность и биомедицина, где модель автоматически переключается на менее мощную версию Opus 4.8.

QКакие проблемы были выявлены у AI-агентов в процессе тестирования ALE по словам авторов?

AАвторы выявили, что AI-агенты часто объявляют задачи выполненными, не проверив результаты, что приводит к отсутствию необходимых файлов, ошибкам в расчётах или нарушению условий задачи. Также отмечается, что не существует «универсального чемпиона» среди моделей, так как каждая имеет свои сильные и слабые области.

Похожее

Почему Чжан Имин отдаёт 50% своего времени Seed?

Чжан Имин, основатель ByteDance, тратит 50% своего времени на исследовательскую группу Seed. Несмотря на то, что публичные продукты компании, такие как Doubao (искусственный интеллект-ассистент), Kouzi (платформа для разработки ИИ) и TRAE (инструмент для программирования), демонстрируют сдержанное развитие и не задают тренды в отрасли, как это было раньше, ключевые стратегические усилия сосредоточены внизу технологического стека. Seed, команда, занимающаяся фундаментальными исследованиями в области ИИ и насчитывающая сотни специалистов, является основой для всех ИИ-продуктов ByteDance. Исторический успех компании (Toutiao, Douyin, TikTok) всегда основывался на переосмыслении фундаментальных технологий (например, алгоритмы рекомендаций), а не на простом копировании форматов продуктов. Сегодня ByteDance делает аналогичную ставку, надеясь, что превосходство в базовых моделях Seed в конечном итоге компенсирует любое отставание на уровне конкретных приложений. Однако в эпоху ИИ ситуация изменилась. Скорость изменения пользовательских интерфейсов и рабочих процессов (например, переход к автономным агентам и рабочим столам с ИИ, как у WorkBuddy от Tencent) может опережать скорость развития базовых возможностей моделей. Успех Doubao с сотнями миллионов пользователей также создает для ByteDance инерцию, сосредоточивая внимание на улучшении существующего помощника, в то время как конкуренты (Tencent, Alibaba) активно интегрируют ИИ в целые экосистемы и системы производительности. Чжан Имин, по-видимому, делает долгосрочную ставку, следуя своему принципу «отсроченного удовлетворения». Он верит, что в конечном итоге все агенты и приложения будут работать на мощной базовой модели, подобной Seed, что сделает борьбу за отдельные точки входа менее важной. Ключевой вопрос заключается в том, успеет ли эта фундаментальная технология стать решающей до того, как привычки пользователей закрепятся вокруг продуктов-лидеров конкурентов. Стратегия ByteDance ставит под сомнение, является ли нынешняя эра ИИ в первую очередь войной продуктов или войной инфраструктур. Ответ на этот вопрос определит исход конкурентной борьбы.

marsbit6 мин. назад

Почему Чжан Имин отдаёт 50% своего времени Seed?

marsbit6 мин. назад

От «спекулятивного актива» к «следующему финансовому базовому слою»: в мире Crypto зарождается новая реальность TradFi

Криптоиндустрия постепенно превращается из спекулятивного рынка в полноценную финансовую инфраструктуру. Начиная с 2026 года, ключевые изменения в различных секторах — стейблкоинах, токенизации реальных активов (RWA), рынках предсказаний и AI-агентах — начали формировать единую систему. Стейблкоины становятся программируемым средством расчетов, доступным для интеграции в приложения. RWA переводят традиционные активы (акции, облигации) в форму, понятную для смарт-контрактов. Рынки предсказаний превращают информацию о будущих событиях в вероятностные цены. AI-агенты начинают выступать в роли новых экономических субъектов, совершая микроплатежи. Вместе эти компоненты создают основу для следующего поколения финансовой инфраструктуры: выпуск и отображение активов, круглосуточные платежи и расчеты, непрерывная торговля и ценовая дискovery, а также системы управления идентификацией и полномочиями. Важным шагом становится и налаживание связи с существующими правовыми и регуляторными системами. Однако переход от «рабочей технологии» к «надежной инфраструктуре» сопряжен с вызовами: необходимость обеспечения юридической силы сделок, определения ответственности за действия AI-агентов, преодоления фрагментации ликвидности, решения вопросов конфиденциальности и создания кредитных механизмов. Таким образом, криптосфера не отказывается от своей спекулятивной составляющей, но под ней формируется новый исполнительный слой, способный обслуживать реальные активы, традиционные институты и автономное программное обеспечение.

marsbit55 мин. назад

От «спекулятивного актива» к «следующему финансовому базовому слою»: в мире Crypto зарождается новая реальность TradFi

marsbit55 мин. назад

Robinhood Chain привлекает ключевых игроков: какие сигналы посылает развертывание «Pools» от Uniswap?

8 августа стало известно, что децентрализованная биржа Uniswap разрабатывает платформу для запуска токенов под названием «Pools» в экосистеме Robinhood Chain. Платформа, доступная на pools.trade, пока находится в стадии подготовки. Этот шаг знаменует собой расширение функций Uniswap от просто инфраструктуры для торговли к платформе для выпуска активов. Pools, как ожидается, предложит два основных механизма запуска: «Crowd Launch» (четырехчасовой аукцион) и «Instant Launch» (использующий механизм кривой связывания), оба направленные на более справедливое и эффективное ценовое открытие. Выбор для развертывания на Robinhood Chain является стратегическим и направлен на привлечение более широкой аудитории розничных инвестторов, упрощая им доступ к DeFi. Это может усилить позиции Robinhood Chain как моста между традиционными финансами и Web3. В настоящее время на рынке наблюдается спекулятивная активность вокруг неофициальных токенов, использующих тематику Pools, но официальный запуск и детали еще предстоит подтвердить. В долгосрочной перспективе успех Pools может превратить Uniswap в ключевую операционную систему для выпуска активов в Web3, определяя новый этап конкуренции в инфраструктуре.

marsbit1 ч. назад

Robinhood Chain привлекает ключевых игроков: какие сигналы посылает развертывание «Pools» от Uniswap?

marsbit1 ч. назад

Сторонники обновления BIP-110 для биткоина подготовили план «на крайний случай», если предложение не будет принято: это может кардинально изменить стоимость BTC

Сторонники предложения BIP-110, направленного на временное ограничение хранения произвольных данных в транзакциях биткоина, подготовили резервный план на случай блокировки обновления майнерами. Разработчик Крис Гуида адаптировал код, позволяющий изменить алгоритм доказательства работы (Proof-of-Work) в Bitcoin Knots. Эта мера рассматривается как крайний вариант, если майнеры не поддержат активацию BIP-110. Инициатива BIP-110, также известная как «временный софтфорк с уменьшенным объемом данных», ужесточает правила для данных в транзакциях и рассчитана на срок около года. Гуида и другие сторонники, такие как Люк Дашджр и Механик, считают, что возможность смены алгоритма майнинга послужит сдерживающим фактором для майнеров и подчеркнет, что правила сети должны определяться операторами узлов, а не майнерами. В случае реализации резервного плана нынешние ASIC-майнеры могут потерять возможность генерировать блоки, что приведет к кардинальной перестройке сети. Однако на данный момент поддержка BIP-110 со стороны майнеров остается ограниченной, и данный сценарий рассматривается лишь как непредвиденная мера.

cryptonews.ru4 ч. назад

Сторонники обновления BIP-110 для биткоина подготовили план «на крайний случай», если предложение не будет принято: это может кардинально изменить стоимость BTC

cryptonews.ru4 ч. назад

Почему цена биткоина осталась устойчивой и не упала, несмотря на недавний крупный хакерский взлом? Вот в чем секрет

В интервью на канале «Волк со всех улиц» эксперты обсудили устойчивость биткоина после хакерской атаки на холодные кошельки на $100 млн. Аналитик Bitwise Райан Расмуссен отметил, что рынок созрел: теперь доминируют институциональные инвесторы, использующие ETF и регулируемые сервисы (Coinbase, Anchorage), поэтому инциденты с частными кошельками почти не влияют на общую ситуацию. Инвестдиректор Bitwise Мэтт Хоуган добавил, что рынок стал более устойчивым к негативным новостям благодаря институциональному капиталу, а оставшиеся инвесторы держат активы твердо. Гендиректор Arch Public Тиллман Холлоуэй констатировал «смену караула»: если раньше цену определяли майнеры и криптобиржи, теперь контроль у Уолл-стрит. Хоуган также указал на разрыв между пессимизмом в соцсетях и долгосрочными стратегиями крупных банков (Morgan Stanley, Wells Fargo, UBS), рассматривающих коррекции как возможность для покупки. Расмуссен отметил, что управляющие портфелями всё чаще включают криптоактивы, рекомендуя выделять на биткоин 1–6%, так как его интеграция в традиционные индексы снизила воспринимаемые риски.

cryptonews.ru5 ч. назад

Почему цена биткоина осталась устойчивой и не упала, несмотря на недавний крупный хакерский взлом? Вот в чем секрет

cryptonews.ru5 ч. назад

Торговля

Спот
活动图片