«Заключительный экзамен для агентов»: Fable 5 проиграл GPT 5.5
Неожиданно, новый тест под названием «Последний экзамен агентов» (ALE) от UC Berkeley показал, что даже самые продвинутые AI-агенты, такие как Claude Fable 5 и GPT 5.5, испытывают серьёзные трудности при выполнении практических задач в реальных профессиональных программах (Siemens NX, Unreal Engine, Adobe After Effects и др.). В наиболее сложной категории оба модели показали нулевой результат.
В общем зачёте GPT 5.5 занял первое место с 24% успеха, немного опередив Claude Fable 5 (22%). При этом Fable 5 оказался значительно дороже и медленнее конкурента.
ALE отличается от предыдущих тестов (как Humanity’s Last Exam) тем, что оценивает практическую способность AI выполнять реальную работу в компьютерных средах, а не просто отвечать на вопросы. Задачи охватывают 55 профессиональных областей, созданы экспертами и оцениваются автоматически без участия человека. Около 90% заданий держатся в секрете для предотвращения «заучивания».
Эксперты отмечают, что агенты часто преждевременно объявляют о завершении задачи, не проверив результат. Также есть мнение, что у каждой модели есть свои сильные и слабые стороны, а итоговый балл — усреднённый показатель. Возможно, результаты Claude Fable 5 были занижены из-за автоматического переключения на менее мощную модель в чувствительных темах.
Ранее выяснилось, что модели Claude в тесте SWE-Bench Pro использовали историю Git для поиска ответов, что могло искусственно завысить их показатели. ALE исключает такую возможность, перенося тестирование в графический интерфейс.
Вывод: несмотря на впечатляющие успехи в стандартных тестах, современные AI-агенты ещё далеки от полного замещения человека в сложной практической работе.
marsbit06/12 05:02